Uredski benchmark
Koji AI najbolje gradi?
Šest modela. Jedan zadatak. Po jedan pokušaj. Ocjene od 0 do 100 prema tačnom ciljnom obliku.
Rang-lista.
Šta je svaki model izgradio.
Izvorni rezultat, prikazan na osnovu JSON-a koji je svaki model vratio. Jedan pokušaj, bez ponavljanja.
Svaka skulptura koristi isto osvjetljenje, kameru i razmjeru. Odaberite bilo koji rezultat da ga uporedite s ciljem ili prebacite na prikaz Razlika da pregledate odstupanja.
Napomene
Kvalitet, tokeni i vrijeme
Koliko je resursa zahtijevao svaki rezultat?
Uporedite ocjenu, prijavljeni zbir ulaznih i izlaznih tokena te proteklo vrijeme izvršavanja za odabrani krug. Tokeni za rezonovanje ne dodaju se ponovo. Mjerenja koja nedostaju izostavljaju se i ne računaju kao nula.
Pogledajte mjerenja tokena i vremena izvršavanja
Izmjereni rezultati
Iz kruga u krug.
Početna referentna vrijednost čuva izvorne rezultate prvog kruga i datume mjerenja. Sljedeća tačka predstavlja novi izmjereni krug, a ne rezultat iz druge sedmice.
Pogledajte zabilježene ocjene
| Krug | Claude Opus 5 / Claude Opus 5.5 | Claude Sonnet 5 / Claude Sonnet 5.5 | Claude Fable | GPT-6.1 Sol | GPT-6 Astra | GPT-6 Luna |
|---|---|---|---|---|---|---|
| 2026-W41 | 78.5 (Claude Opus 5.5) | 48.1 (Claude Sonnet 5.5) | 74.6 (Claude Fable) | 74.7 (GPT-6.1 Sol) | 73.5 (GPT-6 Astra) | 30.9 (GPT-6 Luna) |
| Početna referentna vrijednost | 75.5 (Claude Opus 5) | 34.3 (Claude Sonnet 5) | 71.2 (Claude Fable) | 70.6 (GPT-6.1 Sol) | 77.5 (GPT-6 Astra) | 45.6 (GPT-6 Luna) |
O benchmarku
Dajte AI-ju 150 kvadara. Zatražite ovo.
Okrugla glava. Zakrivljena stolica. Mala stolna lampa. Koliko se jezički model može približiti koristeći samo pravougaone blokove?
- blokova najviše
- 150
- modela
- 6
- pokušaj po krugu
- 1
Kako funkcionira.
Nepromjenjiv opis zadatka.
Svaki model dobija isti pisani opis zadatka s ciljnim dimenzijama i bojama. Cijeli opis zadatka javno je dostupan.
Samo JSON.
Odgovor ne sadrži ništa drugo: do 150 kvadara s položajima, dimenzijama i bojama.
Jedan pokušaj.
Srednji nivo rezonovanja, bez alata i ponovnih pokušaja. Prate se broj tokena i vrijeme izvršavanja.
Nepromjenjiv sistem ocjenjivanja.
Zapreminsko preklapanje s ciljnim oblikom, ponderirano prema tačnosti boja, od 0 do 100.
Formula
postotak zapreminskog preklapanja × udio pravilno obojenih kockiMjeri se u jedinicama od 1 cm³. Digitalni otisak opisa zadatka 08fb5a5773fe89e7. Početna referentna vrijednost čuva izvorne rezultate prvog kruga.
Cjelokupna metodologija i pitanja
Kako funkcionira
U zadatku je naveden svaki oblik predloška s tačnim brojčanim vrijednostima. Svaki model odgovara isključivo u JSON formatu: do 150 kvadara, pri čemu je svaki zadan položajem, veličinom i jednom od 11 boja. Model sam ne crta ništa. Pri ocjenjivanju jednog pokušaja renderiramo njegove kvadre i predložak pomoću istih malih kockica, uz isto osvjetljenje i kameru, te objavljujemo slike.
Ocjena se dobiva množenjem preklapanja zapremine skulpture i predloška (omjer presjeka i unije, mjeren kockicama veličine 1 cm) s udjelom zajedničkih kockica koje imaju ispravnu boju. Jedan kvadar po obliku donosi ocjenu ispod 40; rezanje svakog oblika na jednake slojeve donosi oko 50. Nagnute noge, tanki kablovi i okrugle glave donose bolje rezultate modelima koji planiraju položaj svakog kvadra, a prikaz Razlika pokazuje svaku kockicu koja nedostaje, predstavlja višak ili ima pogrešnu boju.
Pravedno i ponovljivo
Početna referentna vrijednost predstavlja izvorni prvi krug, sačuvan sa stvarnim datumima mjerenja. Za lansiranje je zatražen drugi izmjereni krug. Oba su prikazana; nijednom nije pripisan raniji datum niti je odabran kao bolji od ta dva rezultata. Kasniji krugovi slijede sedmični raspored.
- Isti zadatak, isti program za ocjenjivanje i iste postavke svake sedmice. Zadatak v3 ima digitalni otisak
08fb5a5773fe89e7; svaka promjena pokreće novu verziju i novi grafikon. - Svaki model odgovara jednom uz srednji nivo napora pri zaključivanju, putem Claude Code ili Codex alata uz prijavu s pretplatom, na isti način na koji ih pokreće VibeiDE. Bez alata, weba, ponovnih pokušaja i biranja najboljeg od N odgovora.
- Modeli se pokreću jedan za drugim, nikada paralelno. Ako odgovor ne stigne u roku od 40 minuta, ocjena je 0.
- Program za ocjenjivanje je deterministički. Nijedan model ne ocjenjuje drugi model.
Pročitajte cijeli zadatak (obični tekst, 7,691 znakova). Nazivi modela su aliasi koje nudi svaki CLI; stranica bilježi identifikator modela koji je CLI prijavio.
Pitanja
Postaju li Claude ili GPT slabiji?
Ova stranica nema uvid u interna zbivanja kod pružaoca usluge, ali pokazuje postiže li model pod istim nazivom različite rezultate na istom nepromjenjivom zadatku tokom vremena. Jedno pokretanje sedmično predstavlja samo jedan uzorak, pa promjenu od nekoliko bodova smatrajte šumom, a pad koji traje nekoliko sedmica signalom.
Zašto nijedan model ne može postići 100?
Predložak je sastavljen od kugli, elipsoida, cilindara i nagnutih kapsula, a odgovor smije sadržavati samo 150 kvadara poravnatih s koordinatnim osama. Kvadrima se krivine ne mogu tačno pratiti, pa se u svakom odgovoru gubi dio zapremine. Bolji modeli koriste svoje kvadre tamo gdje su krivine, pa njihove skulpture više liče na predložak.
Kako se modeli pokreću?
Svaki model dobiva zadatak jednom putem svog službenog alata komandne linije, Claude Code ili Codex, uz prijavu s uobičajenom pretplatom i srednji nivo napora pri rezonovanju. Alati, podagenti, pristup webu i ponovni pokušaji su isključeni; izvršavanje koje koristi alat dobiva ocjenu 0. Odgovor ocjenjuje deterministički program, a ne drugi model.
Zašto je test prešao na v3?
U prve dvije verzije modeli su trebali urediti kancelariju. U njihovim prvim rundama najbolji modeli postigli su 100 i 92, a svaka ispravno uređena kancelarija izgledala je isto. Test na kojem najbolji modeli postižu maksimalan rezultat ne može pokazati promjene, a test na kojem odgovori izgledaju slično ne može pokazati kvalitet, pa v3 traži skulpturu čiji se kvalitet vidi na prvi pogled.
Mogu li i sam isprobati zadatak?
Da. Cijeli zadatak javno je dostupan kao obični tekst. Zalijepite ga u bilo koji model i uporedite njegov odgovor s predloškom.