Biroja etalontests
Kurš MI veido vislabāk?
Seši modeļi. Viens uzdevums. Katram viens mēģinājums. Vērtējums no 0 līdz 100 pēc atbilstības precīzam paraugam.
Rezultātu tabula.
Ko izveidoja katrs modelis.
Neapstrādāts rezultāts, vizualizēts no katra modeļa atgrieztā JSON. Viens mēģinājums, bez atkārtotiem mēģinājumiem.
Visām skulptūrām ir vienāds apgaismojums, kamera un mērogs. Atlasi jebkuru rezultātu, lai salīdzinātu to ar paraugu, vai pārslēdzies uz atšķirību skatu, lai izpētītu neatbilstības.
Piezīmes
Kvalitāte, tokeni un laiks
Kas bija nepieciešams katra rezultāta iegūšanai?
Salīdzini izvēlētās kārtas vērtējumu, uzrādīto ievades un izvades tokenu kopskaitu un izpildes ilgumu. Spriešanas tokeni netiek pieskaitīti atkārtoti. Trūkstošie mērījumi netiek iekļauti, un tos neuzskata par nulli.
Apskati tokenu patēriņa un izpildes ilguma mērījumus
Izmērītie rezultāti
No kārtas uz kārtu.
Sākotnējais atskaites punkts saglabā sākotnējos pirmās kārtas rezultātus un mērījumu datumus. Nākamais punkts ir jauna kārta ar jauniem mērījumiem, nevis citas nedēļas rezultāts.
Apskati reģistrētos vērtējumus
| Kārta | Claude Opus 5 / Claude Opus 5.5 | Claude Sonnet 5 / Claude Sonnet 5.5 | Claude Fable | GPT-6.1 Sol | GPT-6 Astra | GPT-6 Luna |
|---|---|---|---|---|---|---|
| 2026-W41 | 78.5 (Claude Opus 5.5) | 48.1 (Claude Sonnet 5.5) | 74.6 (Claude Fable) | 74.7 (GPT-6.1 Sol) | 73.5 (GPT-6 Astra) | 30.9 (GPT-6 Luna) |
| Sākotnējais atskaites punkts | 75.5 (Claude Opus 5) | 34.3 (Claude Sonnet 5) | 71.2 (Claude Fable) | 70.6 (GPT-6.1 Sol) | 77.5 (GPT-6 Astra) | 45.6 (GPT-6 Luna) |
Par etalontestu
Dod MI 150 kastes. Lūdz izveidot šo.
Apaļa galva. Izliekts krēsls. Maza galda lampa. Cik tuvu oriģinālam var tikt valodas modelis, izmantojot tikai taisnstūrveida klučus?
- kluči ne vairāk
- 150
- modeļi
- 6
- mēģinājums katrā kārtā
- 1
Kā tas darbojas.
Fiksēts uzdevuma apraksts.
Katrs modelis saņem vienādu rakstisku uzdevuma aprakstu ar parauga izmēriem un krāsām. Pilns apraksts ir publiski pieejams.
Tikai JSON.
Atbildē nav nekā cita: līdz 150 kastēm ar to pozīcijām, izmēriem un krāsām.
Viens mēģinājums.
Vidējs spriešanas līmenis, bez rīkiem un atkārtotiem mēģinājumiem. Tiek uzskaitīti tokeni un izpildes laiks.
Fiksēta vērtēšanas sistēma.
Tilpuma pārklāšanās ar paraugu, ņemot vērā krāsu precizitāti, skalā no 0 līdz 100.
Formula
tilpuma pārklāšanās % × pareizi iekrāsoto kubu īpatsvarsMērījumi tiek veikti 1 cm³ vienībās. Uzdevuma apraksta kontrolsumma 08fb5a5773fe89e7. Sākotnējā atskaites bāzē ir saglabāti pirmās kārtas sākotnējie rezultāti.
Pilna metodika un jautājumi
Kā tas darbojas
Uzdevuma aprakstā ir uzskaitītas visas parauga formas ar precīzām skaitliskām vērtībām. Katrs modelis atbild tikai JSON formātā: līdz 150 taisnstūra blokiem, katram norādot novietojumu, izmēru un vienu no 11 krāsām. Pats modelis neko nezīmē. Vērtējot izpildes rezultātu, mēs renderējam tā blokus un paraugu no vienādiem maziem kubiem ar vienādu apgaismojumu un kameru un publicējam attēlus.
Vērtējumu aprēķina, skulptūras un parauga kopīgā tilpuma attiecību pret to apvienoto tilpumu, ko mēra 1 cm kubos, reizinot ar pareizās krāsas kubu īpatsvaru kopīgajā tilpumā. Izmantojot vienu bloku katrai formai, vērtējums ir zem 40; sadalot katru formu vienādās šķēlēs, tas ir aptuveni 50. Slīpas kājas, plāni kabeļi un apaļas galvas palīdz iegūt augstāku vērtējumu modeļiem, kas pārdomā katra bloka novietojumu, un skatā Atšķirības ir redzams katrs trūkstošais, liekais un nepareizi iekrāsotais kubs.
Godīgs un atkārtojams
Sākotnējais atskaites punkts ir sākotnējā pirmā kārta, kas saglabāta ar tās faktiskajiem mērījumu datumiem. Pirms palaišanas tika pieprasīta otra kārta ar mērījumiem. Tiek parādītas abas kārtas; nevienai nav piešķirts agrāks datums, un neviena nav izvēlēta kā labākais no diviem rezultātiem. Turpmākās kārtas notiek pēc iknedēļas grafika.
- Katru nedēļu tas pats uzdevuma apraksts, tā pati vērtēšanas programma un tie paši iestatījumi. Uzdevuma apraksta v3 kontrolnospiedums ir
08fb5a5773fe89e7; jebkuras izmaiņas sāk jaunu versiju un jaunu diagrammu. - Katrs modelis atbild vienu reizi ar vidēju spriešanas intensitāti, izmantojot Claude Code vai Codex ar abonementu, tāpat kā tos darbina VibeiDE. Bez rīkiem, piekļuves tīmeklim, atkārtotiem mēģinājumiem un labākās atbildes atlases no N mēģinājumiem.
- Modeļi tiek palaisti cits pēc cita, nekad paralēli. Ja atbilde netiek saņemta 40 minūšu laikā, vērtējums ir 0.
- Vērtēšanu veic deterministiska programma. Neviens modelis nevērtē citu modeli.
Izlasi pilnu uzdevuma aprakstu (vienkāršs teksts, 7,691 rakstzīmes). Modeļu nosaukumi ir katra CLI piedāvātie aizstājvārdi; lapā tiek saglabāts modeļa identifikators, ko uzrādīja CLI.
Jautājumi
Vai Claude vai GPT spējas tiek vājinātas?
Šī lapa nevar parādīt, kas notiek pakalpojuma sniedzēja iekšienē, taču tā rāda, vai modelis ar to pašu nosaukumu laika gaitā saņem atšķirīgu vērtējumu par vienu un to pašu nemainīgo uzdevumu. Viena izpilde nedēļā ir tikai viens novērojums, tāpēc dažu punktu svārstības uztver kā nejaušu variāciju, bet kritumu, kas saglabājas vairākas nedēļas, kā signālu.
Kāpēc neviens modelis nevar sasniegt 100?
Paraugu veido sfēras, elipsoīdi, cilindri un slīpas kapsulas, bet atbildē drīkst izmantot tikai 150 ar koordinātu asīm izlīdzinātus taisnstūra blokus. Bloki nevar precīzi atveidot līknes, tāpēc katrā atbildē daļa tilpuma paliek neatveidota. Labāki modeļi izmanto vairāk bloku izliektajām daļām, un to skulptūras vairāk līdzinās paraugam.
Kā tiek palaisti modeļi?
Katrs modelis uzdevuma aprakstu saņem vienreiz savā oficiālajā komandrindas rīkā, Claude Code vai Codex, ar parastu abonementu un vidēju spriešanas piepūles līmeni. Rīki, apakšaģenti, piekļuve tīmeklim un atkārtoti mēģinājumi ir izslēgti; izpilde, kurā tiek izmantots rīks, saņem 0 punktus. Atbildi vērtē deterministiska programma, nevis cits modelis.
Kāpēc etalontests tika mainīts uz v3?
Pirmajās divās versijās modeļiem bija jāizveido biroja izkārtojums. To pirmajās kārtās labākie modeļi saņēma 100 un 92 punktus, un visi pareizi izveidotie biroji izskatījās vienādi. Etalontests, kurā labākie modeļi sasniedz maksimālo vērtējumu, nevar parādīt attīstību, savukārt tests, kurā atbildes izskatās līdzīgi, nevar parādīt kvalitāti. Tāpēc v3 uzdevums ir izveidot skulptūru, kuras kvalitāte ir redzama uzreiz.
Vai varu pats izmēģināt šo uzdevumu?
Jā. Pilns uzdevuma apraksts ir publiski pieejams vienkārša teksta formātā. Ielīmē to jebkurā modelī un salīdzini tā atbildi ar paraugu.