Benchmark d'uffizi
Tge IA construescha il meglier?
Sis models. Ina incumbensa. In'emprova per mintgin. Valitads da 0 fin 100 tenor la correspundenza exacta cun la mira.
Rangaziun.
Tge che mintga model ha construì.
Resultat brut, visualisà a partir dal JSON che mintga model ha returnà. In'emprova, senza repetiziuns.
Mintga sculptura dovra la medema glisch, camera e scala. Tschernì in resultat per al cumparegliar cun la finamira, u midai a Differenza per examinar las divergenzas.
Remartgas
Qualitad, tokens e temp
Tge resursas ha mintga resultat duvrà?
Cumparegliai la punctaziun, la summa dals tokens d'entrada e da sortida rapportads e il temp d'execuziun per la runda tschernida. Ils tokens da raschunament na vegnan betg agiuntads anc ina giada. Las mesiraziuns mancantas vegnan laschadas davent, betg quintadas sco nulla.
Vesair las mesiraziuns dals tokens e dal temp d'execuziun
Resultats mesirads
Runda per runda.
La basa da partenza mantegna ils resultats originals da l'emprima runda e las datas da mesiraziun. Il proxim punct è ina nova runda mesirada, betg in resultat d'in'autra emna.
Vesair las punctaziuns registradas
| Runda | Claude Opus 5 / Claude Opus 5.5 | Claude Sonnet 5 / Claude Sonnet 5.5 | Claude Fable | GPT-6.1 Sol | GPT-6 Astra | GPT-6 Luna |
|---|---|---|---|---|---|---|
| 2026-W41 | 78.5 (Claude Opus 5.5) | 48.1 (Claude Sonnet 5.5) | 74.6 (Claude Fable) | 74.7 (GPT-6.1 Sol) | 73.5 (GPT-6 Astra) | 30.9 (GPT-6 Luna) |
| Basa da partenza | 75.5 (Claude Opus 5) | 34.3 (Claude Sonnet 5) | 71.2 (Claude Fable) | 70.6 (GPT-6.1 Sol) | 77.5 (GPT-6 Astra) | 45.6 (GPT-6 Luna) |
Davart il benchmark
Dai ad ina IA 150 quaders. Dumandai quest resultat.
In chau radund. Ina sutga curva. Ina pitschna lampa da maisa. Quant datiers po in model da lingua arrivar cun duvrar mo blocs rectangulars?
- blocs maximalmain
- 150
- models
- 6
- emprova per runda
- 1
Co che quai funcziuna.
Ina incumbensa fixada.
Mintga model survegn la medema incumbensa scritta cun las dimensiuns e las colurs da la mira. L'incumbensa cumpletta è publica.
Mo JSON.
La resposta na cuntegna nagut auter: fin a 150 quaders cun posiziuns, grondezzas e colurs.
In'emprova.
In nivel medio da sforz da raschunament, senza utensils e senza repetiziuns. Ils tokens ed il temp d'execuziun vegnan registrads.
In sistem da valitaziun fixà.
La surposiziun dal volumen cun la mira, ponderada tenor la precisiun da las colurs, da 0 fin 100.
La formula
surposiziun dal volumen en % × proporziun dals cubs cun la colur correctaMesirà en unitads dad 1 cm³. Impronta da l'incumbensa 08fb5a5773fe89e7. La basa da partenza mantegna ils resultats originals da l'emprima runda.
Metodologia cumpletta e dumondas
Co che quai funcziuna
L'incumbensa enumerescha mintga furma dal model da referenza cun cifras exactas. Mintga model respunda exclusivamain cun JSON: fin a 150 blocs, mintgin cun ina posiziun, ina grondezza ed ina da 11 colurs. Il model sez na dissegnia nagut. Cur che nus valitain in'execuziun, renderizain nus ses blocs ed il model da referenza cun ils medems pitschens cubs, la medema illuminaziun e la medema camera, e publitgain ils maletgs.
Il dumber da puncts correspunda a la surposiziun dal volumen da la sculptura e dal model da referenza (intersecziun dividida tras l'uniun, mesirada en cubs da 1 cm), multiplitgada cun la proporziun dals cubs communabels cun la colur correcta. In quader per furma dat main che 40 puncts; divider mintga furma en plattas egualas dat circa 50 puncts. Chommas inclinadas, cabels fins e chaus radunds recompenseschan models che planiseschan la posiziun da mintga quader, e la vista Differenza mussa mintga cub mancant, supplementar u cun ina colur fallada.
Gist e repetibel
La basa da partenza è l'emprima runda originala, mantegnida cun las datas effectivas da mesiraziun. Per il lantschament è vegnida dumandada ina segunda runda mesirada. Omaduas vegnan mussadas; nagina n'è vegnida datada retroactivamain u tschernida sco il meglier resultat da las duas. Las rundas ulteriuras suondan il plan emnil.
- La medema incumbensa, il medem program da valitaziun e las medemas configuraziuns mintga emna. L'incumbensa v3 ha l'impronta
08fb5a5773fe89e7; mintga midada cumenza ina nova versiun ed in nov diagram. - Mintga model respunda ina giada cun in nivel mesaun da reflexiun, tras Claude Code u Codex cun ina sessiun averta tras in abunament, exactamain sco VibeiDE ils exequescha. Nagins tools, nagin web, naginas repetiziuns e nagina selecziun da la meglra da N respostas.
- Ils models vegnan exequids in suenter l'auter, mai en parallela. Ina resposta che n'arriva betg entaifer 40 minutas survegn 0 puncts.
- Il program d'evaluaziun è deterministic. Nagin model n'evaluescha in auter model.
Leger l'incumbensa cumpletta (text simpel, 7,691 caracters). Ils nums dals models èn ils alias purschids da mintga CLI; la pagina registrescha l'identificatur dal model rapportà da la CLI.
Dumondas
Daventan Claude u GPT main capabels?
Questa pagina na po betg guardar a l'intern d'in purschider, ma ella mussa sche il medem num da model survegn cun il temp resultats differents per la medema incumbensa fixada. Ina execuziun per emna è ina singula emprova. Considerai perquai ina midada da paucs puncts sco fluctuaziun casuala ed ina diminuziun che dura pliras emnas sco signal.
Pertge na po nagin model cuntanscher 100 puncts?
Il model da referenza consista da sferas, ellipsoids, cilinders e capsulas inclinadas, e la resposta dastga duvrar mo 150 quaderls allineads cun las axas. Quaderls na pon betg suandar exactamain las curvas, uschia che mintga resposta perda ina part dal volumen. Models megliers dovran lur quaderls là nua che las curvas èn, e lur sculpturas sumeglian dapli il model da referenza.
Co vegnan ils models exequids?
Mintga model survegn l'incumbensa ina suletta giada tras ses utensil uffizial da lingia da commandos, Claude Code u Codex, cun ina subscripziun ordinaria e cun in nivel mesaun da reflexiun. Utensils, sutagents, access al web e repetiziuns èn deactivads; in'execuziun che dovra in utensil survegn 0 puncts. La resposta vegn valitada d'in program deterministic, betg d'in auter model.
Pertge è il benchmark passà a v3?
Las emprimas duas versiuns dumandavan als models d'arranschar in biro. En lur emprimas rundas han ils megliers models cuntanschì 100 e 92 puncts, e mintga biro correct aveva il medem aspect. In benchmark en il qual ils megliers models cuntanschan il maximum na po betg mussar midadas, ed in benchmark cun respostas che sumeglian ina l'autra na po betg mussar la qualitad. Perquai dumonda v3 ina sculptura cun ina qualitad visibla a prima vista.
Poss jau empruvar sez l'incumbensa?
Gea. L'incumbensa cumpletta è accessibla publicamain sco text simpel. Copiai ella en in model da Vossa tscherna e cumparegliai sia resposta cun il model da referenza.