Pisarniški primerjalni preizkus

Katera umetna inteligenca gradi najbolje?

Šest modelov. Ena naloga. Vsak ima en poskus. Ocene od 0 do 100 glede na natančno določeno ciljno obliko.

Lestvica.

Kaj je zgradil posamezni model.

Neobdelani izhod, izrisan iz podatkov JSON, ki jih je vrnil posamezni model. En poskus, brez ponovitev.

Teden 2026-W41

Vse skulpture so prikazane z enako osvetlitvijo, kamero in merilom. Izberite poljuben rezultat, da ga primerjate s ciljno skulpturo, ali preklopite na prikaz razlik, da pregledate odstopanja.

  1. Claude Opus 5.578.5/100Skulptura modela Claude Opus 5.5
  2. GPT-6.1 Sol74.7/100Skulptura modela GPT-6.1 Sol
  3. Claude Fable74.6/100Skulptura modela Claude Fable
  4. GPT-6 Astra73.5/100Skulptura modela GPT-6 Astra
  5. Claude Sonnet 5.548.1/100Skulptura modela Claude Sonnet 5.5
  6. GPT-6 Luna30.9/100Skulptura modela GPT-6 Luna

Kakovost, žetoni in čas

Koliko je bilo potrebno za posamezen rezultat?

Primerjajte oceno, sporočeno skupno število vhodnih in izhodnih žetonov ter čas izvajanja za izbrani krog. Žetoni za sklepanje se ne prištevajo znova. Manjkajoče meritve so izpuščene in se ne štejejo kot nič.

Oglejte si meritve porabe žetonov in časa izvajanja

Izmerjeni rezultati

Iz kroga v krog.

Začetno izhodišče ohranja prvotne rezultate prvega kroga in datume meritev. Naslednja točka predstavlja nov izmerjeni krog, ne rezultata iz drugega tedna.

Oglejte si zabeležene ocene
Ocena od 100 po krogih
KrogClaude Opus 5 / Claude Opus 5.5Claude Sonnet 5 / Claude Sonnet 5.5Claude FableGPT-6.1 SolGPT-6 AstraGPT-6 Luna
2026-W4178.5 (Claude Opus 5.5)48.1 (Claude Sonnet 5.5)74.6 (Claude Fable)74.7 (GPT-6.1 Sol)73.5 (GPT-6 Astra)30.9 (GPT-6 Luna)
Začetno izhodišče75.5 (Claude Opus 5)34.3 (Claude Sonnet 5)71.2 (Claude Fable)70.6 (GPT-6.1 Sol)77.5 (GPT-6 Astra)45.6 (GPT-6 Luna)

O primerjalnem preizkusu

Dajte umetni inteligenci 150 kvadrov. Naročite ji, naj sestavi to.

Okrogla glava. Ukrivljen stol. Majhna namizna svetilka. Kako blizu izvirniku lahko pride jezikovni model, če uporablja le kvadre?

Cilj: bel robot na zelenem stolu ob okrogli mizi z monitorjem, svetilko, skodelico in rastlino
Skulptura, ki jo je treba poustvariti. 56 oblik.
kvadrov največ
150
modeli
6
poskus na krog
1

Kako deluje.

Nespremenljiva navodila.

Vsak model prejme enaka pisna navodila s ciljnimi merami in barvami. Celotna navodila so javno dostopna.

Samo JSON.

Odgovor vsebuje samo podatke o največ 150 kvadrih: njihove položaje, velikosti in barve.

En poskus.

Srednja intenzivnost razmišljanja, brez orodij in brez ponovitev. Beležimo število žetonov in čas izvajanja.

Nespremenljiv ocenjevalnik.

Prostorninsko prekrivanje s ciljno obliko, uteženo s pravilnostjo barv, na lestvici od 0 do 100.

Formula

prostorninsko prekrivanje v % × delež pravilno obarvanih kock

Merjeno v enotah po 1 cm³. Prstni odtis navodil 08fb5a5773fe89e7. Začetna referenčna osnova ohranja izvirne rezultate prvega kroga.

Celotna metodologija in vprašanja

Kako deluje

Navodila navajajo vse oblike v predlogi z natančnimi številčnimi podatki. Vsak model odgovori samo v obliki JSON: največ 150 kvadrov, za vsakega pa položaj, velikost in eno od 11 barv. Model sam ne nariše ničesar. Pri ocenjevanju posameznega poskusa njegove kvadre in predlogo izrišemo iz enakih majhnih kock, z enako osvetlitvijo in kamero, ter objavimo slike.

Ocena je prostorninsko prekrivanje skulpture in ciljne skulpture (razmerje med presekom in unijo, merjeno s kockami velikosti 1 cm), pomnoženo z deležem skupnih kock s pravilno barvo. En kvader na obliko prinese oceno pod 40; razrez vsake oblike na enako debele plasti prinese približno 50. Poševne noge, tanki kabli in okrogle glave nagradijo modele, ki načrtujejo položaj vsakega kvadra, prikaz Razlika pa pokaže vsako manjkajočo, odvečno in napačno obarvano kocko.

Pošteno in ponovljivo

Začetno izhodišče je prvotni prvi krog, ohranjen z dejanskimi datumi meritev. Za začetek je bil zahtevan drugi izmerjeni krog. Prikazana sta oba; nobenemu ni pripisan datum za nazaj in nobeden ni izbran kot boljši izmed obeh rezultatov. Nadaljnji krogi potekajo po tedenskem urniku.

  • Vsak teden ista navodila, isti program za ocenjevanje in iste nastavitve. Navodila v3 imajo prstni odtis 08fb5a5773fe89e7; vsaka sprememba pomeni novo različico in nov grafikon.
  • Vsak model odgovori enkrat s srednjo stopnjo poglobljenosti razmišljanja prek Claude Code ali Codex s prijavo z naročnino, enako kot jih zaganja VibeiDE. Brez orodij, spleta, ponovnih poskusov ali izbire najboljšega od N odgovorov.
  • Modeli se izvajajo drug za drugim, nikoli vzporedno. Odgovor, ki ne prispe v 40 minutah, dobi oceno 0.
  • Ocenjevalni program je determinističen. Noben model ne ocenjuje drugega modela.

Preberite celotna navodila (navadno besedilo, 7,691 znakov). Imena modelov so vzdevki, ki jih ponuja posamezni CLI; stran beleži identifikator modela, ki ga je sporočil CLI.

Vprašanja

Ali Claude ali GPT postajata manj zmogljiva?

Ta stran nima vpogleda v notranje delovanje ponudnika, pokaže pa, ali model z istim imenom skozi čas dosega različne ocene pri isti nespremenjeni nalogi. Ena izvedba na teden pomeni en sam vzorec, zato premik za nekaj točk obravnavajte kot šum, padec, ki traja več tednov, pa kot signal.

Zakaj noben model ne more doseči 100?

Ciljna skulptura je sestavljena iz krogel, elipsoidov, valjev in poševnih kapsul, odgovor pa lahko vsebuje le 150 kvadrov, poravnanih s koordinatnimi osmi. Kvadri ne morejo natančno slediti krivinam, zato pri vsakem odgovoru manjka del prostornine. Boljši modeli kvadre razporedijo tam, kjer so krivine, zato so njihove skulpture bolj podobne ciljni.

Kako izvajamo preizkuse modelov?

Vsak model prejme navodila enkrat prek svojega uradnega orodja ukazne vrstice, Claude Code ali Codex, s prijavo prek običajne naročnine in srednjo stopnjo razmišljanja. Orodja, podagenti, dostop do spleta in ponovni poskusi so izklopljeni; izvedba, ki uporabi orodje, dobi oceno 0. Odgovor oceni deterministični program, ne drug model.

Zakaj je primerjalni preizkus prešel na v3?

Prvi dve različici sta od modelov zahtevali postavitev pisarne. V prvih krogih so najboljši modeli dosegli oceni 100 in 92, vse pravilno postavljene pisarne pa so bile videti enako. Preizkus, pri katerem najboljši modeli dosežejo najvišjo oceno, ne more pokazati napredka, preizkus s podobnimi odgovori pa ne more pokazati kakovosti. Zato v3 zahteva skulpturo, katere kakovost je vidna na prvi pogled.

Ali lahko nalogo preizkusim tudi sam?

Da. Celotna navodila so javno dostopna kot navadno besedilo. Prilepite jih v kateri koli model in primerjajte njegov odgovor s ciljno skulpturo.

Jeziki

Necessary cookies support sign-in, security, your language and this choice. Optional categories stay off until accepted.

First-party page views and acquisition measurement, plus Google Analytics 4 (Google Ireland, data may reach the US). Advertising personalization stays off.

With Analytics enabled, retain Google and Microsoft ad click identifiers and share download, signup, activation and purchase conversions with the relevant ad provider. No personalized advertising.

Remember referral credit for later. Links still work on the current page without this cookie.

Privacy · Cookie inventory