Office Benchmark
Ktorá AI stavia najlepšie?
Šesť modelov. Jedno zadanie. Každý má jeden pokus. Hodnotenie od 0 do 100 podľa zhody s presnou predlohou.
Rebríček.
Čo jednotlivé modely vytvorili.
Neupravený výstup vykreslený z JSON, ktorý vrátil každý model. Jeden pokus, bez opakovania.
Každá socha má rovnaké osvetlenie, nastavenie kamery aj mierku. Vyberte ľubovoľný výsledok a porovnajte ho s predlohou alebo prepnite na zobrazenie Rozdiel a preskúmajte odchýlky.
Poznámky
Kvalita, tokeny a čas
Čo si vyžadoval každý výsledok?
Porovnajte skóre, vykázaný súčet vstupných a výstupných tokenov a čas behu vo vybranom kole. Tokeny uvažovania sa nepripočítavajú druhýkrát. Chýbajúce merania sa vynechávajú, nezapočítavajú sa ako nula.
Zobraziť merania tokenov a času behu
Namerané výsledky
Porovnanie jednotlivých kôl.
Východiskové meranie zachováva pôvodné výsledky prvého kola aj dátumy meraní. Nasledujúci bod predstavuje nové merané kolo, nie výsledok z iného týždňa.
Zobraziť zaznamenané skóre
| Kolo | Claude Opus 5 / Claude Opus 5.5 | Claude Sonnet 5 / Claude Sonnet 5.5 | Claude Fable | GPT-6.1 Sol | GPT-6 Astra | GPT-6 Luna |
|---|---|---|---|---|---|---|
| 2026-W41 | 78.5 (Claude Opus 5.5) | 48.1 (Claude Sonnet 5.5) | 74.6 (Claude Fable) | 74.7 (GPT-6.1 Sol) | 73.5 (GPT-6 Astra) | 30.9 (GPT-6 Luna) |
| Východiskové meranie | 75.5 (Claude Opus 5) | 34.3 (Claude Sonnet 5) | 71.2 (Claude Fable) | 70.6 (GPT-6.1 Sol) | 77.5 (GPT-6 Astra) | 45.6 (GPT-6 Luna) |
O benchmarku
Dajte AI 150 kvádrov. Požiadajte ju, aby vytvorila toto.
Okrúhla hlava. Zaoblená stolička. Drobná stolná lampa. Ako verne ich dokáže jazykový model vytvoriť iba z kvádrov?
- kvádrov maximálne
- 150
- modely
- 6
- pokus na kolo
- 1
Ako to funguje.
Nemenné zadanie.
Každý model dostane rovnaké písomné zadanie s cieľovými rozmermi a farbami. Úplné zadanie je verejne dostupné.
Iba JSON.
Odpoveď neobsahuje nič iné: najviac 150 kvádrov s polohami, rozmermi a farbami.
Jeden pokus.
Stredná úroveň úsilia pri uvažovaní, bez nástrojov a opakovaných pokusov. Sledujeme počet tokenov a čas spracovania.
Nemenný hodnotiaci algoritmus.
Objemový prekryv s predlohou vážený podľa presnosti farieb, na stupnici od 0 do 100.
Vzorec
objemový prekryv v % × podiel správne zafarbených kociekMerané v jednotkách 1 cm³. Odtlačok zadania 08fb5a5773fe89e7. Východisková referencia zachováva pôvodné výsledky prvého kola.
Úplná metodika a otázky
Ako to funguje
Zadanie uvádza každý tvar predlohy s presnými číselnými údajmi. Každý model odpovedá výlučne vo formáte JSON: najviac 150 kvádrov, pri každom poloha, veľkosť a jedna z 11 farieb. Samotný model nič nekreslí. Pri hodnotení výsledku vykreslíme jeho kvádre aj predlohu z rovnakých malých kociek, pri rovnakom osvetlení a z rovnakého pohľadu kamery, a obrázky zverejníme.
Skóre je objemová zhoda sochy a predlohy (pomer prieniku k zjednoteniu, meraný v kockách s hranou 1 cm) vynásobená podielom spoločných kociek so správnou farbou. Jeden kváder na každý tvar dosiahne skóre pod 40; rozdelenie každého tvaru na rovnako hrubé vrstvy dosiahne približne 50. Naklonené nohy, tenké káble a okrúhle hlavy zvýhodňujú modely, ktoré plánujú umiestnenie každého kvádra, a zobrazenie Rozdiel ukáže každú chýbajúcu, nadbytočnú aj nesprávne zafarbenú kocku.
Férové a opakovateľné
Východiskové meranie predstavuje pôvodné prvé kolo, zachované so skutočnými dátumami meraní. Pri uvedení na trh bolo vyžiadané druhé merané kolo. Zobrazené sú obe kolá; ani jedno nemá spätne upravený dátum ani nebolo vybrané ako lepší z dvoch výsledkov. Ďalšie kolá sa riadia týždenným harmonogramom.
- Každý týždeň rovnaké zadanie, rovnaký hodnotiaci program a rovnaké nastavenia. Zadanie v3 má digitálny odtlačok
08fb5a5773fe89e7; akákoľvek zmena znamená novú verziu a nový graf. - Každý model odpovedá raz so strednou úrovňou úsilia pri uvažovaní prostredníctvom Claude Code alebo Codex s prihlásením cez predplatné, rovnako ako ich spúšťa VibeiDE. Bez nástrojov, bez webu, bez opakovaných pokusov a bez výberu najlepšej z N odpovedí.
- Modely sa spúšťajú jeden po druhom, nikdy nie súbežne. Ak odpoveď nepríde do 40 minút, výsledné skóre je 0.
- Hodnotiaci program je deterministický. Žiadny model nehodnotí iný model.
Prečítajte si celé zadanie (obyčajný text, 7,691 znakov). Názvy modelov sú aliasy, ktoré ponúka príslušný nástroj CLI; stránka zaznamenáva identifikátor modelu, ktorý nástroj CLI uviedol.
Otázky
Zhoršuje sa výkon modelov Claude alebo GPT?
Táto stránka nevidí do interného fungovania poskytovateľa, ale ukazuje, či model s rovnakým názvom dosahuje pri rovnakom nemennom zadaní v priebehu času odlišné skóre. Jeden beh za týždeň predstavuje jedinú vzorku, preto berte posun o niekoľko bodov ako šum a pokles trvajúci niekoľko týždňov ako signál.
Prečo žiadny model nedokáže dosiahnuť 100?
Predloha pozostáva z gulí, elipsoidov, valcov a naklonených kapsúl, no odpoveď môže obsahovať iba 150 kvádrov zarovnaných so súradnicovými osami. Kvádre nedokážu presne kopírovať krivky, takže v každej odpovedi časť objemu chýba. Lepšie modely využívajú kvádre tam, kde sú zakrivené tvary, a ich sochy sa viac podobajú predlohe.
Ako sa modely spúšťajú?
Každý model dostane zadanie raz prostredníctvom svojho oficiálneho nástroja príkazového riadka, Claude Code alebo Codex, s prihlásením cez bežné predplatné a strednou úrovňou úsilia pri uvažovaní. Nástroje, podagenti, prístup na web a opakované pokusy sú vypnuté; beh, ktorý použije nástroj, získa skóre 0. Odpoveď hodnotí deterministický program, nie iný model.
Prečo benchmark prešiel na v3?
Prvé dve verzie žiadali modely, aby navrhli rozloženie kancelárie. V ich prvých kolách získali najlepšie modely skóre 100 a 92 a každá správne navrhnutá kancelária vyzerala rovnako. Benchmark, v ktorom špičkové modely dosahujú maximum, nedokáže ukázať zmenu, a benchmark s podobne vyzerajúcimi odpoveďami nedokáže ukázať kvalitu. Preto v3 žiada sochu, ktorej kvalita je viditeľná na prvý pohľad.
Môžem si zadanie vyskúšať aj ja?
Áno. Úplné zadanie je verejne dostupné ako obyčajný text. Vložte ho do ľubovoľného modelu a porovnajte jeho odpoveď s predlohou.