Uredni usporedni test

Koji AI najbolje gradi?

Šest modela. Jedan zadatak. Po jedan pokušaj. Ocjene od 0 do 100 prema podudaranju sa zadanim predloškom.

Ljestvica.

Što je svaki model izgradio.

Izvorni rezultat, prikazan na temelju JSON-a koji je svaki model vratio. Jedan pokušaj, bez ponavljanja.

Tjedan 2026-W41

Svaka skulptura prikazana je uz istu rasvjetu, kameru i mjerilo. Odaberite bilo koji rezultat kako biste ga usporedili s ciljem ili prijeđite na prikaz Razlika kako biste pregledali odstupanja.

  1. Claude Opus 5.578.5/100Skulptura modela Claude Opus 5.5
  2. GPT-6.1 Sol74.7/100Skulptura modela GPT-6.1 Sol
  3. Claude Fable74.6/100Skulptura modela Claude Fable
  4. GPT-6 Astra73.5/100Skulptura modela GPT-6 Astra
  5. Claude Sonnet 5.548.1/100Skulptura modela Claude Sonnet 5.5
  6. GPT-6 Luna30.9/100Skulptura modela GPT-6 Luna

Kvaliteta, tokeni i vrijeme

Koliko je resursa bilo potrebno za svaki rezultat?

Usporedite ocjenu, prijavljeni zbroj ulaznih i izlaznih tokena te trajanje izvođenja za odabrani krug. Tokeni za rezoniranje ne pribrajaju se ponovno. Mjerenja koja nedostaju izostavljaju se i ne računaju kao nula.

Pogledajte mjerenja broja tokena i trajanja izvođenja

Izmjereni rezultati

Iz kruga u krug.

Početni referentni rezultati čuvaju izvorne rezultate prvog kruga i datume mjerenja. Sljedeća točka prikazuje novi izmjereni krug, a ne rezultat iz nekog drugog tjedna.

Pogledajte zabilježene ocjene
Ocjena od najviše 100 bodova po krugu
KrugClaude Opus 5 / Claude Opus 5.5Claude Sonnet 5 / Claude Sonnet 5.5Claude FableGPT-6.1 SolGPT-6 AstraGPT-6 Luna
2026-W4178.5 (Claude Opus 5.5)48.1 (Claude Sonnet 5.5)74.6 (Claude Fable)74.7 (GPT-6.1 Sol)73.5 (GPT-6 Astra)30.9 (GPT-6 Luna)
Početni referentni rezultati75.5 (Claude Opus 5)34.3 (Claude Sonnet 5)71.2 (Claude Fable)70.6 (GPT-6.1 Sol)77.5 (GPT-6 Astra)45.6 (GPT-6 Luna)

O usporednom testu

Dajte AI-ju 150 kvadara. Zatražite ovo.

Okrugla glava. Zaobljena stolica. Sićušna stolna svjetiljka. Koliko vjerno jezični model može to prikazati koristeći samo kvadre?

Cilj: bijeli robot na zelenoj stolici za okruglim stolom s monitorom, svjetiljkom, šalicom i biljkom
Skulptura koju treba reproducirati. 56 oblika.
kvadara najviše
150
modela
6
pokušaj po krugu
1

Kako funkcionira.

Fiksne upute.

Svaki model dobiva iste pisane upute sa zadanim dimenzijama i bojama. Cjelovite upute javno su dostupne.

Samo JSON.

Odgovor ne sadrži ništa drugo: do 150 kvadara s položajima, dimenzijama i bojama.

Jedan pokušaj.

Srednja razina napora pri zaključivanju, bez alata i bez ponavljanja. Prate se broj tokena i vrijeme izvršavanja.

Fiksni sustav bodovanja.

Preklapanje volumena s predloškom, ponderirano prema točnosti boja, od 0 do 100.

Formula

postotak preklapanja volumena × udio ispravno obojenih kocki

Mjeri se u jedinicama od 1 cm³. Digitalni otisak uputa 08fb5a5773fe89e7. Početna referentna vrijednost čuva izvorne rezultate prvog kruga.

Cjelovita metodologija i pitanja

Kako funkcionira

U opisu zadatka naveden je svaki oblik zadanog predloška s točnim brojčanim vrijednostima. Svaki model odgovara isključivo u formatu JSON: do 150 kvadara, svaki s položajem, veličinom i jednom od 11 boja. Model sam ništa ne crta. Pri ocjenjivanju rezultata renderiramo njegove kvadre i zadani predložak pomoću istih malih kockica, uz isto osvjetljenje i kameru, te objavljujemo slike.

Ocjena je volumensko preklapanje skulpture i predloška (omjer presjeka i unije, mjeren kockicama veličine 1 cm) pomnoženo s udjelom zajedničkih kockica koje imaju ispravnu boju. Jedan kvadar po obliku donosi ocjenu manju od 40; podjela svakog oblika na jednake slojeve donosi ocjenu oko 50. Kose noge, tanki kabeli i okrugle glave nagrađuju modele koji planiraju položaj svakog kvadra, a prikaz Razlika pokazuje svaku kockicu koja nedostaje, koja je suvišna ili je pogrešne boje.

Pošteno i ponovljivo

Početni referentni rezultati potječu iz izvornog prvog kruga i sačuvani su sa stvarnim datumima mjerenja. Za lansiranje je zatražen drugi krug mjerenja. Prikazana su oba kruga; nijednom nije dodijeljen raniji datum niti je odabran kao bolji od ta dva rezultata. Kasniji krugovi slijede tjedni raspored.

  • Svaki tjedan isti opis zadatka, isti program za ocjenjivanje i iste postavke. Opis zadatka v3 ima digitalni otisak 08fb5a5773fe89e7; svaka promjena pokreće novu verziju i novi grafikon.
  • Svaki model odgovara jednom uz srednju razinu napora pri zaključivanju, putem alata Claude Code ili Codex uz prijavu s pretplatom, na isti način na koji ih pokreće VibeiDE. Bez alata, interneta, ponovnih pokušaja ili odabira najboljeg od N odgovora.
  • Modeli se pokreću jedan za drugim, nikada paralelno. Odgovor koji ne stigne u roku od 40 minuta dobiva ocjenu 0.
  • Program za ocjenjivanje je deterministički. Nijedan model ne ocjenjuje drugi model.

Pročitajte cijeli opis zadatka (običan tekst, 7,691 znakova). Nazivi modela odgovaraju aliasima koje nudi svaki CLI; stranica bilježi identifikator modela koji je CLI prijavio.

Pitanja

Smanjuju li se sposobnosti modela Claude ili GPT?

Ova stranica nema uvid u interne procese pružatelja, ali pokazuje postiže li model istog naziva s vremenom drukčije ocjene na istom nepromjenjivom zadatku. Jedno pokretanje tjedno daje samo jedan uzorak, pa pomak od nekoliko bodova smatrajte šumom, a pad koji traje nekoliko tjedana signalom.

Zašto nijedan model ne može dosegnuti 100?

Predložak se sastoji od kugli, elipsoida, valjaka i kosih kapsula, a odgovor smije sadržavati samo 150 kvadara poravnatih s koordinatnim osima. Kvadri ne mogu točno pratiti zakrivljene oblike, pa u svakom odgovoru nedostaje dio volumena. Bolji modeli raspoređuju kvadre ondje gdje su zakrivljeni dijelovi, pa njihove skulpture više nalikuju predlošku.

Kako se modeli pokreću?

Svaki model dobiva opis zadatka jednom, putem svojeg službenog alata naredbenog retka, Claude Code ili Codex, uz prijavu s uobičajenom pretplatom i srednju razinu napora pri zaključivanju. Alati, podagenti, pristup webu i ponovni pokušaji isključeni su; izvođenje koje upotrijebi alat dobiva ocjenu 0. Odgovor ocjenjuje deterministički program, a ne drugi model.

Zašto je usporedni test prešao na v3?

U prve dvije verzije modeli su trebali osmisliti raspored ureda. U prvim krugovima najbolji modeli postigli su 100 i 92, a svaki ispravno izrađen ured izgledao je jednako. Usporedni test u kojem najbolji modeli dosežu maksimum ne može pokazati napredak, a test u kojem odgovori izgledaju slično ne može pokazati kvalitetu. Zato v3 traži skulpturu čija je kvaliteta vidljiva na prvi pogled.

Mogu li i sami isprobati zadatak?

Da. Cijeli opis zadatka javno je dostupan kao običan tekst. Zalijepite ga u bilo koji model i usporedite njegov odgovor s predloškom.

Jezici

Necessary cookies support sign-in, security, your language and this choice. Optional categories stay off until accepted.

First-party page views and acquisition measurement, plus Google Analytics 4 (Google Ireland, data may reach the US). Advertising personalization stays off.

With Analytics enabled, retain Google and Microsoft ad click identifiers and share download, signup, activation and purchase conversions with the relevant ad provider. No personalized advertising.

Remember referral credit for later. Links still work on the current page without this cookie.

Privacy · Cookie inventory