Prova comparativa d'Office
Quina IA construeix millor?
Sis models. Un únic encàrrec. Un intent per model. Puntuats de 0 a 100 segons la coincidència amb l'objectiu exacte.
Classificació.
Què ha construït cada model.
Resultat en brut, renderitzat a partir del JSON que ha retornat cada model. Un sol intent, sense reintents.
Totes les escultures fan servir la mateixa il·luminació, càmera i escala. Selecciona qualsevol resultat per comparar-lo amb l'objectiu, o canvia a Diferència per examinar les discrepàncies.
Notes
Qualitat, tokens i temps
Quins recursos ha requerit cada resultat?
Compara la puntuació, la suma dels tokens d'entrada i de sortida reportats i el temps d'execució transcorregut de la ronda seleccionada. Els tokens de raonament no es tornen a sumar. Els mesuraments que falten s'ometen, no es compten com a zero.
Consulta els mesuraments de tokens i temps d'execució
Resultats mesurats
Ronda rere ronda.
La referència inicial conserva els resultats originals de la primera ronda i les dates de mesurament. El punt següent correspon a una nova ronda mesurada, no a un resultat d'una altra setmana.
Consulta les puntuacions registrades
| Ronda | Claude Opus 5 / Claude Opus 5.5 | Claude Sonnet 5 / Claude Sonnet 5.5 | Claude Fable | GPT-6.1 Sol | GPT-6 Astra | GPT-6 Luna |
|---|---|---|---|---|---|---|
| 2026-W41 | 78.5 (Claude Opus 5.5) | 48.1 (Claude Sonnet 5.5) | 74.6 (Claude Fable) | 74.7 (GPT-6.1 Sol) | 73.5 (GPT-6 Astra) | 30.9 (GPT-6 Luna) |
| Referència inicial | 75.5 (Claude Opus 5) | 34.3 (Claude Sonnet 5) | 71.2 (Claude Fable) | 70.6 (GPT-6.1 Sol) | 77.5 (GPT-6 Astra) | 45.6 (GPT-6 Luna) |
Sobre la prova comparativa
Dona 150 caixes a una IA. Demana-li això.
Un cap rodó. Una cadira corba. Un llum d'escriptori diminut. Fins a quin punt s'hi pot acostar un model de llenguatge fent servir només blocs rectangulars?
- blocs com a màxim
- 150
- models
- 6
- intent per ronda
- 1
Com funciona.
Un encàrrec fixat.
Tots els models reben el mateix encàrrec escrit amb les dimensions i els colors de l'objectiu. L'encàrrec complet és públic.
Només JSON.
La resposta no conté res més: fins a 150 caixes amb posicions, mides i colors.
Un sol intent.
Esforç de raonament mitjà, sense eines ni reintents. Es registren els tokens i el temps d'execució.
Un sistema de puntuació fixat.
Solapament del volum amb l'objectiu, ponderat per la precisió dels colors, de 0 a 100.
La fórmula
% de solapament del volum × proporció de cubs amb el color correcteMesurat en unitats d'1 cm³. Empremta de l'encàrrec 08fb5a5773fe89e7. La referència inicial conserva els resultats originals de la primera ronda.
Metodologia completa i preguntes
Com funciona
L’encàrrec detalla totes les formes del model de referència amb valors exactes. Cada model respon només amb JSON: fins a 150 blocs, cadascun amb una posició, unes dimensions i un dels 11 colors. El model no dibuixa res per si mateix. Quan es puntua una execució, renderitzem els seus blocs i el model de referència amb els mateixos cubs petits, la mateixa il·luminació i la mateixa càmera, i publiquem les imatges.
La puntuació és el solapament de volum entre l'escultura i el model de referència (intersecció dividida per la unió, mesurada en cubs d'1 cm) multiplicat per la proporció de cubs compartits amb el color correcte. Una caixa per forma obté menys de 40 punts; dividir cada forma en làmines iguals n'obté uns 50. Les potes inclinades, els cables prims i els caps rodons afavoreixen els models que planifiquen on va cada caixa, i la vista Diferència mostra tots els cubs que falten, que sobren o que tenen un color incorrecte.
Justa i repetible
La referència inicial és la primera ronda original, conservada amb les dates reals de mesurament. Es va demanar una segona ronda mesurada per al llançament. Es mostren totes dues; no s'ha assignat una data anterior a cap de les dues ni se n'ha triat una com el millor resultat de les dues. Les rondes posteriors segueixen el calendari setmanal.
- Les mateixes especificacions, el mateix programa de puntuació i la mateixa configuració cada setmana. Les especificacions v3 tenen l'empremta digital
08fb5a5773fe89e7; qualsevol canvi dona lloc a una nova versió i un nou gràfic. - Cada model respon una sola vegada amb un nivell mitjà d'esforç de raonament, a través de Claude Code o Codex amb una sessió iniciada amb una subscripció, tal com els executa VibeiDE. Sense eines, sense web, sense reintents i sense seleccionar la millor de N respostes.
- Els models s'executen l'un darrere l'altre, mai en paral·lel. Si una resposta no arriba en 40 minuts, rep 0 punts.
- El programa de puntuació és determinista. Cap model avalua un altre model.
Llegeix les especificacions completes (text pla, 7,691 caràcters). Els noms dels models són els àlies que ofereix cada CLI; la pàgina registra l'identificador del model que ha comunicat la CLI.
Preguntes
Estan reduint les capacitats de Claude o GPT?
Aquesta pàgina no pot veure què passa dins d'un proveïdor, però mostra si un model amb el mateix nom obté puntuacions diferents al llarg del temps en una tasca fixa. Una execució per setmana és una sola mostra: considera que una variació de pocs punts és soroll i que una baixada que dura diverses setmanes és un senyal.
Per què cap model no pot arribar a 100?
El model de referència està fet d'esferes, el·lipsoides, cilindres i càpsules inclinades, i la resposta només pot utilitzar 150 caixes alineades amb els eixos. Les caixes no poden seguir les corbes amb exactitud, de manera que totes les respostes perden una part del volum. Els models més bons concentren les caixes allà on hi ha corbes, i les seves escultures s'assemblen més al model de referència.
Com s'executen els models?
Cada model rep les especificacions una sola vegada a través de la seva eina oficial de línia d'ordres, Claude Code o Codex, amb una sessió iniciada amb una subscripció normal i un esforç de raonament mitjà. Les eines, els subagents, l'accés web i els reintents estan desactivats; qualsevol execució que utilitzi una eina obté 0 punts. Un programa determinista puntua la resposta, no pas un altre model.
Per què la prova comparativa va passar a la v3?
Les dues primeres versions demanaven als models que dissenyessin la distribució d'una oficina. A les primeres rondes, els millors models van obtenir 100 i 92 punts, i totes les oficines correctes tenien el mateix aspecte. Una prova comparativa en què els millors models arriben a la puntuació màxima no permet mostrar l'evolució, i una en què les respostes s'assemblen no permet mostrar la qualitat. Per això, la v3 demana una escultura amb una qualitat que es pugui apreciar d'un cop d'ull.
Puc provar l'enunciat pel meu compte?
Sí. Les especificacions completes són públiques en text pla. Enganxa-les en qualsevol model i compara'n la resposta amb el model de referència.