Biroja etalontests

Kurš MI veido vislabāk?

Seši modeļi. Viens uzdevums. Katram viens mēģinājums. Vērtējums no 0 līdz 100 pēc atbilstības precīzam paraugam.

Rezultātu tabula.

Ko izveidoja katrs modelis.

Neapstrādāts rezultāts, vizualizēts no katra modeļa atgrieztā JSON. Viens mēģinājums, bez atkārtotiem mēģinājumiem.

Nedēļa 2026-W41

Visām skulptūrām ir vienāds apgaismojums, kamera un mērogs. Atlasi jebkuru rezultātu, lai salīdzinātu to ar paraugu, vai pārslēdzies uz atšķirību skatu, lai izpētītu neatbilstības.

  1. Claude Opus 5.578.5/100Claude Opus 5.5 skulptūra
  2. GPT-6.1 Sol74.7/100GPT-6.1 Sol skulptūra
  3. Claude Fable74.6/100Claude Fable skulptūra
  4. GPT-6 Astra73.5/100GPT-6 Astra skulptūra
  5. Claude Sonnet 5.548.1/100Claude Sonnet 5.5 skulptūra
  6. GPT-6 Luna30.9/100GPT-6 Luna skulptūra

Kvalitāte, tokeni un laiks

Kas bija nepieciešams katra rezultāta iegūšanai?

Salīdzini izvēlētās kārtas vērtējumu, uzrādīto ievades un izvades tokenu kopskaitu un izpildes ilgumu. Spriešanas tokeni netiek pieskaitīti atkārtoti. Trūkstošie mērījumi netiek iekļauti, un tos neuzskata par nulli.

Apskati tokenu patēriņa un izpildes ilguma mērījumus

Izmērītie rezultāti

No kārtas uz kārtu.

Sākotnējais atskaites punkts saglabā sākotnējos pirmās kārtas rezultātus un mērījumu datumus. Nākamais punkts ir jauna kārta ar jauniem mērījumiem, nevis citas nedēļas rezultāts.

Apskati reģistrētos vērtējumus
Vērtējums no 100 punktiem katrā kārtā
KārtaClaude Opus 5 / Claude Opus 5.5Claude Sonnet 5 / Claude Sonnet 5.5Claude FableGPT-6.1 SolGPT-6 AstraGPT-6 Luna
2026-W4178.5 (Claude Opus 5.5)48.1 (Claude Sonnet 5.5)74.6 (Claude Fable)74.7 (GPT-6.1 Sol)73.5 (GPT-6 Astra)30.9 (GPT-6 Luna)
Sākotnējais atskaites punkts75.5 (Claude Opus 5)34.3 (Claude Sonnet 5)71.2 (Claude Fable)70.6 (GPT-6.1 Sol)77.5 (GPT-6 Astra)45.6 (GPT-6 Luna)

Par etalontestu

Dod MI 150 kastes. Lūdz izveidot šo.

Apaļa galva. Izliekts krēsls. Maza galda lampa. Cik tuvu oriģinālam var tikt valodas modelis, izmantojot tikai taisnstūrveida klučus?

Paraugs: balts robots zaļā krēslā pie apaļa galda ar monitoru, lampu, krūzi un augu
Skulptūra, kas jāatveido. 56 formas.
kluči ne vairāk
150
modeļi
6
mēģinājums katrā kārtā
1

Kā tas darbojas.

Fiksēts uzdevuma apraksts.

Katrs modelis saņem vienādu rakstisku uzdevuma aprakstu ar parauga izmēriem un krāsām. Pilns apraksts ir publiski pieejams.

Tikai JSON.

Atbildē nav nekā cita: līdz 150 kastēm ar to pozīcijām, izmēriem un krāsām.

Viens mēģinājums.

Vidējs spriešanas līmenis, bez rīkiem un atkārtotiem mēģinājumiem. Tiek uzskaitīti tokeni un izpildes laiks.

Fiksēta vērtēšanas sistēma.

Tilpuma pārklāšanās ar paraugu, ņemot vērā krāsu precizitāti, skalā no 0 līdz 100.

Formula

tilpuma pārklāšanās % × pareizi iekrāsoto kubu īpatsvars

Mērījumi tiek veikti 1 cm³ vienībās. Uzdevuma apraksta kontrolsumma 08fb5a5773fe89e7. Sākotnējā atskaites bāzē ir saglabāti pirmās kārtas sākotnējie rezultāti.

Pilna metodika un jautājumi

Kā tas darbojas

Uzdevuma aprakstā ir uzskaitītas visas parauga formas ar precīzām skaitliskām vērtībām. Katrs modelis atbild tikai JSON formātā: līdz 150 taisnstūra blokiem, katram norādot novietojumu, izmēru un vienu no 11 krāsām. Pats modelis neko nezīmē. Vērtējot izpildes rezultātu, mēs renderējam tā blokus un paraugu no vienādiem maziem kubiem ar vienādu apgaismojumu un kameru un publicējam attēlus.

Vērtējumu aprēķina, skulptūras un parauga kopīgā tilpuma attiecību pret to apvienoto tilpumu, ko mēra 1 cm kubos, reizinot ar pareizās krāsas kubu īpatsvaru kopīgajā tilpumā. Izmantojot vienu bloku katrai formai, vērtējums ir zem 40; sadalot katru formu vienādās šķēlēs, tas ir aptuveni 50. Slīpas kājas, plāni kabeļi un apaļas galvas palīdz iegūt augstāku vērtējumu modeļiem, kas pārdomā katra bloka novietojumu, un skatā Atšķirības ir redzams katrs trūkstošais, liekais un nepareizi iekrāsotais kubs.

Godīgs un atkārtojams

Sākotnējais atskaites punkts ir sākotnējā pirmā kārta, kas saglabāta ar tās faktiskajiem mērījumu datumiem. Pirms palaišanas tika pieprasīta otra kārta ar mērījumiem. Tiek parādītas abas kārtas; nevienai nav piešķirts agrāks datums, un neviena nav izvēlēta kā labākais no diviem rezultātiem. Turpmākās kārtas notiek pēc iknedēļas grafika.

  • Katru nedēļu tas pats uzdevuma apraksts, tā pati vērtēšanas programma un tie paši iestatījumi. Uzdevuma apraksta v3 kontrolnospiedums ir 08fb5a5773fe89e7; jebkuras izmaiņas sāk jaunu versiju un jaunu diagrammu.
  • Katrs modelis atbild vienu reizi ar vidēju spriešanas intensitāti, izmantojot Claude Code vai Codex ar abonementu, tāpat kā tos darbina VibeiDE. Bez rīkiem, piekļuves tīmeklim, atkārtotiem mēģinājumiem un labākās atbildes atlases no N mēģinājumiem.
  • Modeļi tiek palaisti cits pēc cita, nekad paralēli. Ja atbilde netiek saņemta 40 minūšu laikā, vērtējums ir 0.
  • Vērtēšanu veic deterministiska programma. Neviens modelis nevērtē citu modeli.

Izlasi pilnu uzdevuma aprakstu (vienkāršs teksts, 7,691 rakstzīmes). Modeļu nosaukumi ir katra CLI piedāvātie aizstājvārdi; lapā tiek saglabāts modeļa identifikators, ko uzrādīja CLI.

Jautājumi

Vai Claude vai GPT spējas tiek vājinātas?

Šī lapa nevar parādīt, kas notiek pakalpojuma sniedzēja iekšienē, taču tā rāda, vai modelis ar to pašu nosaukumu laika gaitā saņem atšķirīgu vērtējumu par vienu un to pašu nemainīgo uzdevumu. Viena izpilde nedēļā ir tikai viens novērojums, tāpēc dažu punktu svārstības uztver kā nejaušu variāciju, bet kritumu, kas saglabājas vairākas nedēļas, kā signālu.

Kāpēc neviens modelis nevar sasniegt 100?

Paraugu veido sfēras, elipsoīdi, cilindri un slīpas kapsulas, bet atbildē drīkst izmantot tikai 150 ar koordinātu asīm izlīdzinātus taisnstūra blokus. Bloki nevar precīzi atveidot līknes, tāpēc katrā atbildē daļa tilpuma paliek neatveidota. Labāki modeļi izmanto vairāk bloku izliektajām daļām, un to skulptūras vairāk līdzinās paraugam.

Kā tiek palaisti modeļi?

Katrs modelis uzdevuma aprakstu saņem vienreiz savā oficiālajā komandrindas rīkā, Claude Code vai Codex, ar parastu abonementu un vidēju spriešanas piepūles līmeni. Rīki, apakšaģenti, piekļuve tīmeklim un atkārtoti mēģinājumi ir izslēgti; izpilde, kurā tiek izmantots rīks, saņem 0 punktus. Atbildi vērtē deterministiska programma, nevis cits modelis.

Kāpēc etalontests tika mainīts uz v3?

Pirmajās divās versijās modeļiem bija jāizveido biroja izkārtojums. To pirmajās kārtās labākie modeļi saņēma 100 un 92 punktus, un visi pareizi izveidotie biroji izskatījās vienādi. Etalontests, kurā labākie modeļi sasniedz maksimālo vērtējumu, nevar parādīt attīstību, savukārt tests, kurā atbildes izskatās līdzīgi, nevar parādīt kvalitāti. Tāpēc v3 uzdevums ir izveidot skulptūru, kuras kvalitāte ir redzama uzreiz.

Vai varu pats izmēģināt šo uzdevumu?

Jā. Pilns uzdevuma apraksts ir publiski pieejams vienkārša teksta formātā. Ielīmē to jebkurā modelī un salīdzini tā atbildi ar paraugu.

Valodas

Necessary cookies support sign-in, security, your language and this choice. Optional categories stay off until accepted.

First-party page views and acquisition measurement, plus Google Analytics 4 (Google Ireland, data may reach the US). Advertising personalization stays off.

With Analytics enabled, retain Google and Microsoft ad click identifiers and share download, signup, activation and purchase conversions with the relevant ad provider. No personalized advertising.

Remember referral credit for later. Links still work on the current page without this cookie.

Privacy · Cookie inventory