Biuro lyginamasis testas

Kuris DI konstruoja geriausiai?

Šeši modeliai. Viena užduotis. Kiekvienam po vieną bandymą. Vertinama nuo 0 iki 100 pagal tikslų atitikimą etalonui.

Rezultatų lentelė.

Ką sukonstravo kiekvienas modelis.

Neapdoroti rezultatai, atvaizduoti pagal kiekvieno modelio grąžintą JSON. Vienas bandymas, be pakartojimų.

Savaitė 2026-W41

Visoms skulptūroms naudojamas vienodas apšvietimas, kamera ir mastelis. Pasirinkite bet kurį rezultatą ir palyginkite jį su pavyzdžiu arba perjunkite į skirtumų rodinį, kad apžiūrėtumėte neatitikimus.

  1. Claude Opus 5.578.5/100Claude Opus 5.5 skulptūra
  2. GPT-6.1 Sol74.7/100GPT-6.1 Sol skulptūra
  3. Claude Fable74.6/100Claude Fable skulptūra
  4. GPT-6 Astra73.5/100GPT-6 Astra skulptūra
  5. Claude Sonnet 5.548.1/100Claude Sonnet 5.5 skulptūra
  6. GPT-6 Luna30.9/100GPT-6 Luna skulptūra

Kokybė, žetonai ir laikas

Kiek išteklių prireikė kiekvienam rezultatui?

Palyginkite pasirinkto etapo įvertinimą, nurodytą bendrą įvesties ir išvesties žetonų skaičių bei vykdymo trukmę. Samprotavimo žetonai pakartotinai nepridedami. Trūkstami matavimai neįtraukiami, o ne laikomi nuliais.

Peržiūrėkite žetonų skaičiaus ir vykdymo trukmės matavimus

Išmatuoti rezultatai

Raundas po raundo.

Pradiniuose atskaitos rezultatuose išsaugoti originalūs pirmojo etapo rezultatai ir matavimo datos. Kitas taškas rodo naujo išmatuoto etapo rezultatus, o ne kitos savaitės rezultatą.

Peržiūrėkite užfiksuotus įvertinimus
Įvertinimas iš 100 pagal etapą
EtapasClaude Opus 5 / Claude Opus 5.5Claude Sonnet 5 / Claude Sonnet 5.5Claude FableGPT-6.1 SolGPT-6 AstraGPT-6 Luna
2026-W4178.5 (Claude Opus 5.5)48.1 (Claude Sonnet 5.5)74.6 (Claude Fable)74.7 (GPT-6.1 Sol)73.5 (GPT-6 Astra)30.9 (GPT-6 Luna)
Pradiniai atskaitos rezultatai75.5 (Claude Opus 5)34.3 (Claude Sonnet 5)71.2 (Claude Fable)70.6 (GPT-6.1 Sol)77.5 (GPT-6 Astra)45.6 (GPT-6 Luna)

Apie lyginamąjį testą

Duokite DI 150 stačiakampių gretasienių. Paprašykite sukurti štai tai.

Apvali galva. Lenktas krėslas. Mažytė stalinė lempa. Kaip tiksliai kalbos modelis gali tai atkurti naudodamas vien stačiakampius blokus?

Pavyzdys: baltas robotas ant žalio krėslo prie apvalaus stalo su monitoriumi, lempa, puodeliu ir augalu
Skulptūra, kurią reikia atkurti. 56 figūros.
blokų daugiausia
150
modeliai
6
bandymas per etapą
1

Kaip tai veikia.

Nekintantis užduoties aprašas.

Kiekvienas modelis gauna tą patį rašytinį užduoties aprašą su etaloniniais matmenimis ir spalvomis. Visas aprašas yra viešas.

Tik JSON.

Atsakyme nėra nieko daugiau: iki 150 stačiakampių gretasienių su jų padėtimis, dydžiais ir spalvomis.

Vienas bandymas.

Vidutinis samprotavimo pastangų lygis, be įrankių ir pakartotinių bandymų. Fiksuojamas žetonų skaičius ir vykdymo laikas.

Nekintantis vertinimo algoritmas.

Tūrio sutapimas su etalonu, įvertinant spalvų tikslumą, nuo 0 iki 100.

Formulė

tūrio sutapimas % × teisingai nuspalvintų kubelių dalis

Matuojama 1 cm³ vienetais. Užduoties aprašo kontrolinis atspaudas 08fb5a5773fe89e7. Pradiniame atskaitos taške išsaugoti originalūs pirmojo raundo rezultatai.

Visa metodika ir klausimai

Kaip tai veikia

Užduoties apraše išvardytos visos etalono formos ir pateikti tikslūs skaičiai. Kiekvienas modelis atsako tik JSON formatu: pateikia iki 150 stačiakampių blokų, nurodydamas kiekvieno padėtį, dydį ir vieną iš 11 spalvų. Pats modelis nieko nepiešia. Vertindami rezultatą, jo blokus ir etaloną atvaizduojame iš tokių pačių mažų kubelių, naudodami tą patį apšvietimą ir kamerą, ir paskelbiame vaizdus.

Įvertinimas apskaičiuojamas skulptūros ir etalono tūrių sutapimą (sankirtos ir sąjungos santykį, matuojamą 1 cm kubeliais) padauginus iš sutampančių kubelių dalies, kurios spalva teisinga. Kiekvienai formai skyrus po vieną gretasienį, surenkama mažiau nei 40; kiekvieną formą padalijus į vienodus sluoksnius, surenkama apie 50. Pasvirusios kojos, ploni laidai ir apvalios galvos padeda išsiskirti modeliams, kurie suplanuoja kiekvieno gretasienio vietą, o skirtumų rodinyje matomas kiekvienas trūkstamas, perteklinis ir neteisingos spalvos kubelis.

Sąžininga ir pakartojama

Pradiniai atskaitos rezultatai yra originalūs pirmojo etapo rezultatai, išsaugoti su tikrosiomis matavimo datomis. Prieš pristatymą buvo paprašyta atlikti antrą matuojamą etapą. Rodomi abu etapai; nė vieno datos nenukeltos į praeitį ir nė vienas nepasirinktas kaip geriausias iš dviejų rezultatų. Vėlesni etapai vykdomi pagal savaitinį tvarkaraštį.

  • Kiekvieną savaitę naudojama ta pati užduotis, ta pati vertinimo programa ir tie patys nustatymai. Užduoties v3 kontrolinis atspaudas yra 08fb5a5773fe89e7; bet koks pakeitimas reiškia naują versiją ir naują diagramą.
  • Kiekvienas modelis atsako vieną kartą, pasirinkus vidutinį samprotavimo intensyvumą, per Claude Code arba Codex ir prisijungus su prenumerata, taip pat, kaip juos paleidžia VibeiDE. Be įrankių, interneto, pakartotinių bandymų ar geriausio atsakymo atrankos iš N bandymų.
  • Modeliai paleidžiami vienas po kito, niekada lygiagrečiai. Jei atsakymas negaunamas per 40 minučių, skiriama 0 balų.
  • Vertinimo programa yra deterministinė. Nė vienas modelis nevertina kito modelio.

Skaityti visą užduotį (paprastasis tekstas, 7,691 simbolis). Modelių pavadinimai yra kiekvieno CLI siūlomi alternatyvūs vardai; puslapyje užfiksuojamas CLI pateiktas modelio identifikatorius.

Klausimai

Ar Claude arba GPT galimybės silpninamos?

Šis puslapis negali atskleisti, kas vyksta pas teikėją, tačiau parodo, ar tuo pačiu pavadinimu veikiantis modelis laikui bėgant gauna skirtingus balus už tą pačią nekintamą užduotį. Vienas bandymas per savaitę yra tik vienas stebėjimas, todėl kelių balų pokytį laikykite atsitiktiniu svyravimu, o kelias savaites trunkantį kritimą laikykite signalu.

Kodėl nė vienas modelis negali pasiekti 100?

Etaloną sudaro sferos, elipsoidai, cilindrai ir pasvirusios kapsulės, o atsakyme galima naudoti tik 150 pagal koordinačių ašis orientuotų stačiakampių gretasienių. Gretasieniai negali tiksliai atkartoti kreivių, todėl kiekviename atsakyme prarandama dalis tūrio. Geresni modeliai daugiau gretasienių skiria išlenktoms vietoms, tad jų skulptūros labiau primena etaloną.

Kaip paleidžiami modeliai?

Kiekvienam modeliui užduotis vieną kartą pateikiama per jo oficialų komandinės eilutės įrankį, Claude Code arba Codex, prisijungus su įprasta prenumerata ir pasirinkus vidutinį samprotavimo intensyvumą. Įrankiai, pagalbiniai agentai, prieiga prie interneto ir pakartotiniai bandymai išjungti; bandymas, kuriame panaudojamas įrankis, įvertinamas 0. Atsakymą vertina deterministinė programa, o ne kitas modelis.

Kodėl vertinimo testas pakeistas į v3?

Pirmosiose dviejose versijose modelių buvo prašoma suplanuoti biurą. Pirmuosiuose jų etapuose geriausi modeliai surinko 100 ir 92, o visi teisingai suplanuoti biurai atrodė vienodai. Testas, kuriame geriausi modeliai pasiekia didžiausią įvertinimą, negali parodyti pokyčių, o testas, kurio atsakymai atrodo vienodai, negali parodyti kokybės. Todėl v3 prašoma sukurti skulptūrą, kurios kokybė matoma iš pirmo žvilgsnio.

Ar galiu pats išbandyti užduotį?

Taip. Visa užduotis viešai pateikta paprastojo teksto formatu. Įklijuokite ją į bet kurį modelį ir palyginkite jo atsakymą su etalonu.

Kalbos

Necessary cookies support sign-in, security, your language and this choice. Optional categories stay off until accepted.

First-party page views and acquisition measurement, plus Google Analytics 4 (Google Ireland, data may reach the US). Advertising personalization stays off.

With Analytics enabled, retain Google and Microsoft ad click identifiers and share download, signup, activation and purchase conversions with the relevant ad provider. No personalized advertising.

Remember referral credit for later. Links still work on the current page without this cookie.

Privacy · Cookie inventory