Office'i võrdlustest

Milline tehisintellekt ehitab kõige paremini?

Kuus mudelit. Üks lähteülesanne. Igaühel üks katse. Täpse sihtkujundi järgi hinnatud skaalal 0 kuni 100.

Edetabel.

Mida iga mudel ehitas.

Töötlemata väljund, mis on renderdatud iga mudeli tagastatud JSON-ist. Üks katse, korduskatseteta.

Nädal 2026-W41

Kõiki skulptuure näidatakse sama valgustuse, kaamera ja mõõtkavaga. Vali tulemus, et võrrelda seda eeskujuga, või lülitu erinevuste vaatesse, et uurida lahknevusi.

  1. Claude Opus 5.578.5/100Claude Opus 5.5e skulptuur
  2. GPT-6.1 Sol74.7/100GPT-6.1 Soli skulptuur
  3. Claude Fable74.6/100Claude Fable'i skulptuur
  4. GPT-6 Astra73.5/100GPT-6 Astra skulptuur
  5. Claude Sonnet 5.548.1/100Claude Sonnet 5.5' skulptuur
  6. GPT-6 Luna30.9/100GPT-6 Luna skulptuur

Kvaliteet, tokenid ja aeg

Kui palju ressursse iga tulemus nõudis?

Võrdle valitud vooru skoori, raporteeritud sisend- ja väljundtokenite koguarvu ning kulunud käitusaega. Arutlustokeneid ei liideta uuesti juurde. Puuduvad mõõtmised jäetakse välja, mitte ei arvestata nullina.

Vaata tokenite ja käitusaja mõõtmisi

Mõõdetud tulemused

Voorust vooru.

Algne võrdlustase säilitab esimese vooru algsed tulemused ja mõõtmiskuupäevad. Järgmine punkt tähistab uut mõõdetud vooru, mitte mõne teise nädala tulemust.

Vaata salvestatud skoore
Skoor 100-punktisel skaalal voorude kaupa
VoorClaude Opus 5 / Claude Opus 5.5Claude Sonnet 5 / Claude Sonnet 5.5Claude FableGPT-6.1 SolGPT-6 AstraGPT-6 Luna
2026-W4178.5 (Claude Opus 5.5)48.1 (Claude Sonnet 5.5)74.6 (Claude Fable)74.7 (GPT-6.1 Sol)73.5 (GPT-6 Astra)30.9 (GPT-6 Luna)
Algne võrdlustase75.5 (Claude Opus 5)34.3 (Claude Sonnet 5)71.2 (Claude Fable)70.6 (GPT-6.1 Sol)77.5 (GPT-6 Astra)45.6 (GPT-6 Luna)

Võrdlustestist

Anna tehisintellektile 150 kasti. Palu ehitada see.

Ümmargune pea. Kumer tool. Tilluke laualamp. Kui täpselt suudab keelemudel seda jäljendada, kasutades ainult risttahukakujulisi klotse?

Eeskuju: valge robot rohelisel toolil ümara laua ääres, laual monitor, lamp, kruus ja taim
Skulptuur, mida tuleb jäljendada. 56 kujundit.
klotsi maksimaalselt
150
mudelit
6
katse vooru kohta
1

Kuidas see toimib.

Fikseeritud lähteülesanne.

Iga mudel saab sama kirjaliku lähteülesande koos sihtkujundi mõõtmete ja värvidega. Kogu lähteülesanne on avalik.

Ainult JSON.

Vastus ei sisalda midagi muud: kuni 150 kasti koos asukohtade, mõõtmete ja värvidega.

Üks katse.

Keskmine arutluspingutus, tööriistu ega korduskatseid ei kasutata. Jälgitakse tokenite arvu ja täitmisaega.

Fikseeritud hindamisalgoritm.

Ruumala kattuvus sihtkujundiga, kaalutud värvide täpsusega, skaalal 0 kuni 100.

Valem

ruumala kattuvus % × õigesti värvitud kuupide osakaal

Mõõdetakse 1 cm³ ühikutes. Lähteülesande sõrmejälg 08fb5a5773fe89e7. Algne võrdlusalus säilitab esimese vooru algsed tulemused.

Täielik metoodika ja küsimused

Kuidas see töötab

Ülesande kirjelduses on loetletud kõik sihtkuju kujundid koos täpsete arvandmetega. Iga mudel vastab ainult JSON-vormingus: kuni 150 risttahukat, millest igaühel on asukoht, mõõtmed ja üks 11 värvist. Mudel ise ei joonista midagi. Katse hindamisel renderdame mudeli risttahukad ja sihtkuju samadest väikestest kuupidest, sama valgustuse ja kaameraga, ning avaldame pildid.

Punktisumma saadakse skulptuuri ja etaloni ruumala kattuvuse (ühisosa ja ühendi suhe, mõõdetuna 1 cm kuupides) korrutamisel õige värviga kuupide osakaaluga ühisosas. Üks risttahukas kujundi kohta annab alla 40 punkti; iga kujundi jagamine võrdseteks kihtideks annab umbes 50 punkti. Kaldus jalad, õhukesed kaablid ja ümmargused pead annavad eelise mudelitele, mis kavandavad iga risttahuka asukohta, ning vaade Erinevus näitab kõiki puuduvaid, liigseid ja vale värviga kuupe.

Õiglane ja korratav

Algne võrdlustase on algne esimene voor, mis on säilitatud koos tegelike mõõtmiskuupäevadega. Avalikustamise ajaks paluti teha teine mõõdetud voor. Kuvatakse mõlemad; kummagi kuupäevi ei ole varasemaks muudetud ega üht neist valitud kahe vooru parimaks tulemuseks. Hilisemad voorud toimuvad iganädalase ajakava järgi.

  • Igal nädalal kasutatakse sama ülesannet, sama hindamisprogrammi ja samu seadeid. Ülesande v3 sõrmejälg on 08fb5a5773fe89e7; iga muudatusega algab uus versioon ja uus graafik.
  • Iga mudel vastab ühe korra keskmise arutlustasemega Claude Code'i või Codexi kaudu, tellimusega sisse logituna, samamoodi nagu VibeiDE neid käivitab. Ei tööriistu, veebi, korduskatseid ega N katsest parima valimist.
  • Mudelid käivitatakse üksteise järel, mitte kunagi paralleelselt. Vastus, mis ei saabu 40 minuti jooksul, saab 0 punkti.
  • Hindamisprogramm on deterministlik. Ükski mudel ei hinda teist mudelit.

Loe täielikku ülesannet (lihttekst, 7,691 märki). Mudelinimed on iga CLI pakutavad aliased; lehel talletatakse CLI teatatud mudeli identifikaator.

Küsimused

Kas Claude'i või GPT võimekust vähendatakse?

See leht ei näe teenusepakkuja sisemisi muudatusi, kuid näitab, kas sama nimega mudel saab aja jooksul sama muutumatu ülesande eest erinevaid punkte. Üks käivitus nädalas annab vaid ühe valimi, seega käsitle mõnepunktilist muutust mürana ja mitu nädalat kestvat langust signaalina.

Miks ei suuda ükski mudel saada 100 punkti?

Etalon koosneb keradest, ellipsoididest, silindritest ja kaldus kapslitest, kuid vastuses võib kasutada vaid 150 telgedega joondatud risttahukat. Risttahukad ei saa kõveraid täpselt järgida, seega jääb igas vastuses osa ruumalast puudu. Paremad mudelid kasutavad risttahukaid seal, kus on kõverad, ja nende skulptuurid sarnanevad rohkem etaloniga.

Kuidas mudeleid käivitatakse?

Iga mudel saab ülesande ühe korra oma ametliku käsureatööriista Claude Code või Codex kaudu, kasutades tavalise tellimusega kontot ja keskmist arutluspingutust. Tööriistad, alamagendid, veebijuurdepääs ja korduskatsed on välja lülitatud; tööriista kasutanud katse saab 0 punkti. Vastust hindab deterministlik programm, mitte teine mudel.

Miks läks võrdlustest üle versioonile v3?

Esimeses kahes versioonis pidid mudelid kujundama kontori. Nende esimestes voorudes said parimad mudelid 100 ja 92 punkti ning kõik õigesti kujundatud kontorid nägid ühesugused välja. Võrdlustest, milles tippmudelid saavutavad maksimumi, ei saa näidata arengut, ja test, mille vastused näevad sarnased välja, ei saa näidata kvaliteeti. Seetõttu nõuab v3 skulptuuri, mille kvaliteet on kohe silmaga näha.

Kas saan ülesannet ise proovida?

Jah. Täielik ülesanne on avalikult saadaval lihttekstina. Kleebi see mis tahes mudelisse ja võrdle selle vastust etaloniga.

Keeled

Necessary cookies support sign-in, security, your language and this choice. Optional categories stay off until accepted.

First-party page views and acquisition measurement, plus Google Analytics 4 (Google Ireland, data may reach the US). Advertising personalization stays off.

With Analytics enabled, retain Google and Microsoft ad click identifiers and share download, signup, activation and purchase conversions with the relevant ad provider. No personalized advertising.

Remember referral credit for later. Links still work on the current page without this cookie.

Privacy · Cookie inventory