Pisarniški primerjalni preizkus
Katera umetna inteligenca gradi najbolje?
Šest modelov. Ena naloga. Vsak ima en poskus. Ocene od 0 do 100 glede na natančno določeno ciljno obliko.
Lestvica.
Kaj je zgradil posamezni model.
Neobdelani izhod, izrisan iz podatkov JSON, ki jih je vrnil posamezni model. En poskus, brez ponovitev.
Vse skulpture so prikazane z enako osvetlitvijo, kamero in merilom. Izberite poljuben rezultat, da ga primerjate s ciljno skulpturo, ali preklopite na prikaz razlik, da pregledate odstopanja.
Opombe
Kakovost, žetoni in čas
Koliko je bilo potrebno za posamezen rezultat?
Primerjajte oceno, sporočeno skupno število vhodnih in izhodnih žetonov ter čas izvajanja za izbrani krog. Žetoni za sklepanje se ne prištevajo znova. Manjkajoče meritve so izpuščene in se ne štejejo kot nič.
Oglejte si meritve porabe žetonov in časa izvajanja
Izmerjeni rezultati
Iz kroga v krog.
Začetno izhodišče ohranja prvotne rezultate prvega kroga in datume meritev. Naslednja točka predstavlja nov izmerjeni krog, ne rezultata iz drugega tedna.
Oglejte si zabeležene ocene
| Krog | Claude Opus 5 / Claude Opus 5.5 | Claude Sonnet 5 / Claude Sonnet 5.5 | Claude Fable | GPT-6.1 Sol | GPT-6 Astra | GPT-6 Luna |
|---|---|---|---|---|---|---|
| 2026-W41 | 78.5 (Claude Opus 5.5) | 48.1 (Claude Sonnet 5.5) | 74.6 (Claude Fable) | 74.7 (GPT-6.1 Sol) | 73.5 (GPT-6 Astra) | 30.9 (GPT-6 Luna) |
| Začetno izhodišče | 75.5 (Claude Opus 5) | 34.3 (Claude Sonnet 5) | 71.2 (Claude Fable) | 70.6 (GPT-6.1 Sol) | 77.5 (GPT-6 Astra) | 45.6 (GPT-6 Luna) |
O primerjalnem preizkusu
Dajte umetni inteligenci 150 kvadrov. Naročite ji, naj sestavi to.
Okrogla glava. Ukrivljen stol. Majhna namizna svetilka. Kako blizu izvirniku lahko pride jezikovni model, če uporablja le kvadre?
- kvadrov največ
- 150
- modeli
- 6
- poskus na krog
- 1
Kako deluje.
Nespremenljiva navodila.
Vsak model prejme enaka pisna navodila s ciljnimi merami in barvami. Celotna navodila so javno dostopna.
Samo JSON.
Odgovor vsebuje samo podatke o največ 150 kvadrih: njihove položaje, velikosti in barve.
En poskus.
Srednja intenzivnost razmišljanja, brez orodij in brez ponovitev. Beležimo število žetonov in čas izvajanja.
Nespremenljiv ocenjevalnik.
Prostorninsko prekrivanje s ciljno obliko, uteženo s pravilnostjo barv, na lestvici od 0 do 100.
Formula
prostorninsko prekrivanje v % × delež pravilno obarvanih kockMerjeno v enotah po 1 cm³. Prstni odtis navodil 08fb5a5773fe89e7. Začetna referenčna osnova ohranja izvirne rezultate prvega kroga.
Celotna metodologija in vprašanja
Kako deluje
Navodila navajajo vse oblike v predlogi z natančnimi številčnimi podatki. Vsak model odgovori samo v obliki JSON: največ 150 kvadrov, za vsakega pa položaj, velikost in eno od 11 barv. Model sam ne nariše ničesar. Pri ocenjevanju posameznega poskusa njegove kvadre in predlogo izrišemo iz enakih majhnih kock, z enako osvetlitvijo in kamero, ter objavimo slike.
Ocena je prostorninsko prekrivanje skulpture in ciljne skulpture (razmerje med presekom in unijo, merjeno s kockami velikosti 1 cm), pomnoženo z deležem skupnih kock s pravilno barvo. En kvader na obliko prinese oceno pod 40; razrez vsake oblike na enako debele plasti prinese približno 50. Poševne noge, tanki kabli in okrogle glave nagradijo modele, ki načrtujejo položaj vsakega kvadra, prikaz Razlika pa pokaže vsako manjkajočo, odvečno in napačno obarvano kocko.
Pošteno in ponovljivo
Začetno izhodišče je prvotni prvi krog, ohranjen z dejanskimi datumi meritev. Za začetek je bil zahtevan drugi izmerjeni krog. Prikazana sta oba; nobenemu ni pripisan datum za nazaj in nobeden ni izbran kot boljši izmed obeh rezultatov. Nadaljnji krogi potekajo po tedenskem urniku.
- Vsak teden ista navodila, isti program za ocenjevanje in iste nastavitve. Navodila v3 imajo prstni odtis
08fb5a5773fe89e7; vsaka sprememba pomeni novo različico in nov grafikon. - Vsak model odgovori enkrat s srednjo stopnjo poglobljenosti razmišljanja prek Claude Code ali Codex s prijavo z naročnino, enako kot jih zaganja VibeiDE. Brez orodij, spleta, ponovnih poskusov ali izbire najboljšega od N odgovorov.
- Modeli se izvajajo drug za drugim, nikoli vzporedno. Odgovor, ki ne prispe v 40 minutah, dobi oceno 0.
- Ocenjevalni program je determinističen. Noben model ne ocenjuje drugega modela.
Preberite celotna navodila (navadno besedilo, 7,691 znakov). Imena modelov so vzdevki, ki jih ponuja posamezni CLI; stran beleži identifikator modela, ki ga je sporočil CLI.
Vprašanja
Ali Claude ali GPT postajata manj zmogljiva?
Ta stran nima vpogleda v notranje delovanje ponudnika, pokaže pa, ali model z istim imenom skozi čas dosega različne ocene pri isti nespremenjeni nalogi. Ena izvedba na teden pomeni en sam vzorec, zato premik za nekaj točk obravnavajte kot šum, padec, ki traja več tednov, pa kot signal.
Zakaj noben model ne more doseči 100?
Ciljna skulptura je sestavljena iz krogel, elipsoidov, valjev in poševnih kapsul, odgovor pa lahko vsebuje le 150 kvadrov, poravnanih s koordinatnimi osmi. Kvadri ne morejo natančno slediti krivinam, zato pri vsakem odgovoru manjka del prostornine. Boljši modeli kvadre razporedijo tam, kjer so krivine, zato so njihove skulpture bolj podobne ciljni.
Kako izvajamo preizkuse modelov?
Vsak model prejme navodila enkrat prek svojega uradnega orodja ukazne vrstice, Claude Code ali Codex, s prijavo prek običajne naročnine in srednjo stopnjo razmišljanja. Orodja, podagenti, dostop do spleta in ponovni poskusi so izklopljeni; izvedba, ki uporabi orodje, dobi oceno 0. Odgovor oceni deterministični program, ne drug model.
Zakaj je primerjalni preizkus prešel na v3?
Prvi dve različici sta od modelov zahtevali postavitev pisarne. V prvih krogih so najboljši modeli dosegli oceni 100 in 92, vse pravilno postavljene pisarne pa so bile videti enako. Preizkus, pri katerem najboljši modeli dosežejo najvišjo oceno, ne more pokazati napredka, preizkus s podobnimi odgovori pa ne more pokazati kakovosti. Zato v3 zahteva skulpturo, katere kakovost je vidna na prvi pogled.
Ali lahko nalogo preizkusim tudi sam?
Da. Celotna navodila so javno dostopna kot navadno besedilo. Prilepite jih v kateri koli model in primerjajte njegov odgovor s ciljno skulpturo.