Prova comparativa d'Office

Quina IA construeix millor?

Sis models. Un únic encàrrec. Un intent per model. Puntuats de 0 a 100 segons la coincidència amb l'objectiu exacte.

Classificació.

Què ha construït cada model.

Resultat en brut, renderitzat a partir del JSON que ha retornat cada model. Un sol intent, sense reintents.

Setmana 2026-W41

Totes les escultures fan servir la mateixa il·luminació, càmera i escala. Selecciona qualsevol resultat per comparar-lo amb l'objectiu, o canvia a Diferència per examinar les discrepàncies.

  1. Claude Opus 5.578.5/100Escultura de Claude Opus 5.5
  2. GPT-6.1 Sol74.7/100Escultura de GPT-6.1 Sol
  3. Claude Fable74.6/100Escultura de Claude Fable
  4. GPT-6 Astra73.5/100Escultura de GPT-6 Astra
  5. Claude Sonnet 5.548.1/100Escultura de Claude Sonnet 5.5
  6. GPT-6 Luna30.9/100Escultura de GPT-6 Luna

Qualitat, tokens i temps

Quins recursos ha requerit cada resultat?

Compara la puntuació, la suma dels tokens d'entrada i de sortida reportats i el temps d'execució transcorregut de la ronda seleccionada. Els tokens de raonament no es tornen a sumar. Els mesuraments que falten s'ometen, no es compten com a zero.

Consulta els mesuraments de tokens i temps d'execució

Resultats mesurats

Ronda rere ronda.

La referència inicial conserva els resultats originals de la primera ronda i les dates de mesurament. El punt següent correspon a una nova ronda mesurada, no a un resultat d'una altra setmana.

Consulta les puntuacions registrades
Puntuació sobre 100 per ronda
RondaClaude Opus 5 / Claude Opus 5.5Claude Sonnet 5 / Claude Sonnet 5.5Claude FableGPT-6.1 SolGPT-6 AstraGPT-6 Luna
2026-W4178.5 (Claude Opus 5.5)48.1 (Claude Sonnet 5.5)74.6 (Claude Fable)74.7 (GPT-6.1 Sol)73.5 (GPT-6 Astra)30.9 (GPT-6 Luna)
Referència inicial75.5 (Claude Opus 5)34.3 (Claude Sonnet 5)71.2 (Claude Fable)70.6 (GPT-6.1 Sol)77.5 (GPT-6 Astra)45.6 (GPT-6 Luna)

Sobre la prova comparativa

Dona 150 caixes a una IA. Demana-li això.

Un cap rodó. Una cadira corba. Un llum d'escriptori diminut. Fins a quin punt s'hi pot acostar un model de llenguatge fent servir només blocs rectangulars?

L'objectiu: un robot blanc assegut en una cadira verda davant d'un escriptori rodó amb un monitor, un llum, una tassa i una planta
L'escultura que cal recrear. 56 formes.
blocs com a màxim
150
models
6
intent per ronda
1

Com funciona.

Un encàrrec fixat.

Tots els models reben el mateix encàrrec escrit amb les dimensions i els colors de l'objectiu. L'encàrrec complet és públic.

Només JSON.

La resposta no conté res més: fins a 150 caixes amb posicions, mides i colors.

Un sol intent.

Esforç de raonament mitjà, sense eines ni reintents. Es registren els tokens i el temps d'execució.

Un sistema de puntuació fixat.

Solapament del volum amb l'objectiu, ponderat per la precisió dels colors, de 0 a 100.

La fórmula

% de solapament del volum × proporció de cubs amb el color correcte

Mesurat en unitats d'1 cm³. Empremta de l'encàrrec 08fb5a5773fe89e7. La referència inicial conserva els resultats originals de la primera ronda.

Metodologia completa i preguntes

Com funciona

L’encàrrec detalla totes les formes del model de referència amb valors exactes. Cada model respon només amb JSON: fins a 150 blocs, cadascun amb una posició, unes dimensions i un dels 11 colors. El model no dibuixa res per si mateix. Quan es puntua una execució, renderitzem els seus blocs i el model de referència amb els mateixos cubs petits, la mateixa il·luminació i la mateixa càmera, i publiquem les imatges.

La puntuació és el solapament de volum entre l'escultura i el model de referència (intersecció dividida per la unió, mesurada en cubs d'1 cm) multiplicat per la proporció de cubs compartits amb el color correcte. Una caixa per forma obté menys de 40 punts; dividir cada forma en làmines iguals n'obté uns 50. Les potes inclinades, els cables prims i els caps rodons afavoreixen els models que planifiquen on va cada caixa, i la vista Diferència mostra tots els cubs que falten, que sobren o que tenen un color incorrecte.

Justa i repetible

La referència inicial és la primera ronda original, conservada amb les dates reals de mesurament. Es va demanar una segona ronda mesurada per al llançament. Es mostren totes dues; no s'ha assignat una data anterior a cap de les dues ni se n'ha triat una com el millor resultat de les dues. Les rondes posteriors segueixen el calendari setmanal.

  • Les mateixes especificacions, el mateix programa de puntuació i la mateixa configuració cada setmana. Les especificacions v3 tenen l'empremta digital 08fb5a5773fe89e7; qualsevol canvi dona lloc a una nova versió i un nou gràfic.
  • Cada model respon una sola vegada amb un nivell mitjà d'esforç de raonament, a través de Claude Code o Codex amb una sessió iniciada amb una subscripció, tal com els executa VibeiDE. Sense eines, sense web, sense reintents i sense seleccionar la millor de N respostes.
  • Els models s'executen l'un darrere l'altre, mai en paral·lel. Si una resposta no arriba en 40 minuts, rep 0 punts.
  • El programa de puntuació és determinista. Cap model avalua un altre model.

Llegeix les especificacions completes (text pla, 7,691 caràcters). Els noms dels models són els àlies que ofereix cada CLI; la pàgina registra l'identificador del model que ha comunicat la CLI.

Preguntes

Estan reduint les capacitats de Claude o GPT?

Aquesta pàgina no pot veure què passa dins d'un proveïdor, però mostra si un model amb el mateix nom obté puntuacions diferents al llarg del temps en una tasca fixa. Una execució per setmana és una sola mostra: considera que una variació de pocs punts és soroll i que una baixada que dura diverses setmanes és un senyal.

Per què cap model no pot arribar a 100?

El model de referència està fet d'esferes, el·lipsoides, cilindres i càpsules inclinades, i la resposta només pot utilitzar 150 caixes alineades amb els eixos. Les caixes no poden seguir les corbes amb exactitud, de manera que totes les respostes perden una part del volum. Els models més bons concentren les caixes allà on hi ha corbes, i les seves escultures s'assemblen més al model de referència.

Com s'executen els models?

Cada model rep les especificacions una sola vegada a través de la seva eina oficial de línia d'ordres, Claude Code o Codex, amb una sessió iniciada amb una subscripció normal i un esforç de raonament mitjà. Les eines, els subagents, l'accés web i els reintents estan desactivats; qualsevol execució que utilitzi una eina obté 0 punts. Un programa determinista puntua la resposta, no pas un altre model.

Per què la prova comparativa va passar a la v3?

Les dues primeres versions demanaven als models que dissenyessin la distribució d'una oficina. A les primeres rondes, els millors models van obtenir 100 i 92 punts, i totes les oficines correctes tenien el mateix aspecte. Una prova comparativa en què els millors models arriben a la puntuació màxima no permet mostrar l'evolució, i una en què les respostes s'assemblen no permet mostrar la qualitat. Per això, la v3 demana una escultura amb una qualitat que es pugui apreciar d'un cop d'ull.

Puc provar l'enunciat pel meu compte?

Sí. Les especificacions completes són públiques en text pla. Enganxa-les en qualsevol model i compara'n la resposta amb el model de referència.

Idiomes

Necessary cookies support sign-in, security, your language and this choice. Optional categories stay off until accepted.

First-party page views and acquisition measurement, plus Google Analytics 4 (Google Ireland, data may reach the US). Advertising personalization stays off.

With Analytics enabled, retain Google and Microsoft ad click identifiers and share download, signup, activation and purchase conversions with the relevant ad provider. No personalized advertising.

Remember referral credit for later. Links still work on the current page without this cookie.

Privacy · Cookie inventory