Office'i võrdlustest
Milline tehisintellekt ehitab kõige paremini?
Kuus mudelit. Üks lähteülesanne. Igaühel üks katse. Täpse sihtkujundi järgi hinnatud skaalal 0 kuni 100.
Edetabel.
Mida iga mudel ehitas.
Töötlemata väljund, mis on renderdatud iga mudeli tagastatud JSON-ist. Üks katse, korduskatseteta.
Kõiki skulptuure näidatakse sama valgustuse, kaamera ja mõõtkavaga. Vali tulemus, et võrrelda seda eeskujuga, või lülitu erinevuste vaatesse, et uurida lahknevusi.
Märkused
Kvaliteet, tokenid ja aeg
Kui palju ressursse iga tulemus nõudis?
Võrdle valitud vooru skoori, raporteeritud sisend- ja väljundtokenite koguarvu ning kulunud käitusaega. Arutlustokeneid ei liideta uuesti juurde. Puuduvad mõõtmised jäetakse välja, mitte ei arvestata nullina.
Vaata tokenite ja käitusaja mõõtmisi
Mõõdetud tulemused
Voorust vooru.
Algne võrdlustase säilitab esimese vooru algsed tulemused ja mõõtmiskuupäevad. Järgmine punkt tähistab uut mõõdetud vooru, mitte mõne teise nädala tulemust.
Vaata salvestatud skoore
| Voor | Claude Opus 5 / Claude Opus 5.5 | Claude Sonnet 5 / Claude Sonnet 5.5 | Claude Fable | GPT-6.1 Sol | GPT-6 Astra | GPT-6 Luna |
|---|---|---|---|---|---|---|
| 2026-W41 | 78.5 (Claude Opus 5.5) | 48.1 (Claude Sonnet 5.5) | 74.6 (Claude Fable) | 74.7 (GPT-6.1 Sol) | 73.5 (GPT-6 Astra) | 30.9 (GPT-6 Luna) |
| Algne võrdlustase | 75.5 (Claude Opus 5) | 34.3 (Claude Sonnet 5) | 71.2 (Claude Fable) | 70.6 (GPT-6.1 Sol) | 77.5 (GPT-6 Astra) | 45.6 (GPT-6 Luna) |
Võrdlustestist
Anna tehisintellektile 150 kasti. Palu ehitada see.
Ümmargune pea. Kumer tool. Tilluke laualamp. Kui täpselt suudab keelemudel seda jäljendada, kasutades ainult risttahukakujulisi klotse?
- klotsi maksimaalselt
- 150
- mudelit
- 6
- katse vooru kohta
- 1
Kuidas see toimib.
Fikseeritud lähteülesanne.
Iga mudel saab sama kirjaliku lähteülesande koos sihtkujundi mõõtmete ja värvidega. Kogu lähteülesanne on avalik.
Ainult JSON.
Vastus ei sisalda midagi muud: kuni 150 kasti koos asukohtade, mõõtmete ja värvidega.
Üks katse.
Keskmine arutluspingutus, tööriistu ega korduskatseid ei kasutata. Jälgitakse tokenite arvu ja täitmisaega.
Fikseeritud hindamisalgoritm.
Ruumala kattuvus sihtkujundiga, kaalutud värvide täpsusega, skaalal 0 kuni 100.
Valem
ruumala kattuvus % × õigesti värvitud kuupide osakaalMõõdetakse 1 cm³ ühikutes. Lähteülesande sõrmejälg 08fb5a5773fe89e7. Algne võrdlusalus säilitab esimese vooru algsed tulemused.
Täielik metoodika ja küsimused
Kuidas see töötab
Ülesande kirjelduses on loetletud kõik sihtkuju kujundid koos täpsete arvandmetega. Iga mudel vastab ainult JSON-vormingus: kuni 150 risttahukat, millest igaühel on asukoht, mõõtmed ja üks 11 värvist. Mudel ise ei joonista midagi. Katse hindamisel renderdame mudeli risttahukad ja sihtkuju samadest väikestest kuupidest, sama valgustuse ja kaameraga, ning avaldame pildid.
Punktisumma saadakse skulptuuri ja etaloni ruumala kattuvuse (ühisosa ja ühendi suhe, mõõdetuna 1 cm kuupides) korrutamisel õige värviga kuupide osakaaluga ühisosas. Üks risttahukas kujundi kohta annab alla 40 punkti; iga kujundi jagamine võrdseteks kihtideks annab umbes 50 punkti. Kaldus jalad, õhukesed kaablid ja ümmargused pead annavad eelise mudelitele, mis kavandavad iga risttahuka asukohta, ning vaade Erinevus näitab kõiki puuduvaid, liigseid ja vale värviga kuupe.
Õiglane ja korratav
Algne võrdlustase on algne esimene voor, mis on säilitatud koos tegelike mõõtmiskuupäevadega. Avalikustamise ajaks paluti teha teine mõõdetud voor. Kuvatakse mõlemad; kummagi kuupäevi ei ole varasemaks muudetud ega üht neist valitud kahe vooru parimaks tulemuseks. Hilisemad voorud toimuvad iganädalase ajakava järgi.
- Igal nädalal kasutatakse sama ülesannet, sama hindamisprogrammi ja samu seadeid. Ülesande v3 sõrmejälg on
08fb5a5773fe89e7; iga muudatusega algab uus versioon ja uus graafik. - Iga mudel vastab ühe korra keskmise arutlustasemega Claude Code'i või Codexi kaudu, tellimusega sisse logituna, samamoodi nagu VibeiDE neid käivitab. Ei tööriistu, veebi, korduskatseid ega N katsest parima valimist.
- Mudelid käivitatakse üksteise järel, mitte kunagi paralleelselt. Vastus, mis ei saabu 40 minuti jooksul, saab 0 punkti.
- Hindamisprogramm on deterministlik. Ükski mudel ei hinda teist mudelit.
Loe täielikku ülesannet (lihttekst, 7,691 märki). Mudelinimed on iga CLI pakutavad aliased; lehel talletatakse CLI teatatud mudeli identifikaator.
Küsimused
Kas Claude'i või GPT võimekust vähendatakse?
See leht ei näe teenusepakkuja sisemisi muudatusi, kuid näitab, kas sama nimega mudel saab aja jooksul sama muutumatu ülesande eest erinevaid punkte. Üks käivitus nädalas annab vaid ühe valimi, seega käsitle mõnepunktilist muutust mürana ja mitu nädalat kestvat langust signaalina.
Miks ei suuda ükski mudel saada 100 punkti?
Etalon koosneb keradest, ellipsoididest, silindritest ja kaldus kapslitest, kuid vastuses võib kasutada vaid 150 telgedega joondatud risttahukat. Risttahukad ei saa kõveraid täpselt järgida, seega jääb igas vastuses osa ruumalast puudu. Paremad mudelid kasutavad risttahukaid seal, kus on kõverad, ja nende skulptuurid sarnanevad rohkem etaloniga.
Kuidas mudeleid käivitatakse?
Iga mudel saab ülesande ühe korra oma ametliku käsureatööriista Claude Code või Codex kaudu, kasutades tavalise tellimusega kontot ja keskmist arutluspingutust. Tööriistad, alamagendid, veebijuurdepääs ja korduskatsed on välja lülitatud; tööriista kasutanud katse saab 0 punkti. Vastust hindab deterministlik programm, mitte teine mudel.
Miks läks võrdlustest üle versioonile v3?
Esimeses kahes versioonis pidid mudelid kujundama kontori. Nende esimestes voorudes said parimad mudelid 100 ja 92 punkti ning kõik õigesti kujundatud kontorid nägid ühesugused välja. Võrdlustest, milles tippmudelid saavutavad maksimumi, ei saa näidata arengut, ja test, mille vastused näevad sarnased välja, ei saa näidata kvaliteeti. Seetõttu nõuab v3 skulptuuri, mille kvaliteet on kohe silmaga näha.
Kas saan ülesannet ise proovida?
Jah. Täielik ülesanne on avalikult saadaval lihttekstina. Kleebi see mis tahes mudelisse ja võrdle selle vastust etaloniga.