Office Benchmark

Ktorá AI stavia najlepšie?

Šesť modelov. Jedno zadanie. Každý má jeden pokus. Hodnotenie od 0 do 100 podľa zhody s presnou predlohou.

Rebríček.

Čo jednotlivé modely vytvorili.

Neupravený výstup vykreslený z JSON, ktorý vrátil každý model. Jeden pokus, bez opakovania.

Týždeň 2026-W41

Každá socha má rovnaké osvetlenie, nastavenie kamery aj mierku. Vyberte ľubovoľný výsledok a porovnajte ho s predlohou alebo prepnite na zobrazenie Rozdiel a preskúmajte odchýlky.

  1. Claude Opus 5.578.5/100Socha od Claude Opus 5.5
  2. GPT-6.1 Sol74.7/100Socha od GPT-6.1 Sol
  3. Claude Fable74.6/100Socha od Claude Fable
  4. GPT-6 Astra73.5/100Socha od GPT-6 Astra
  5. Claude Sonnet 5.548.1/100Socha od Claude Sonnet 5.5
  6. GPT-6 Luna30.9/100Socha od GPT-6 Luna

Kvalita, tokeny a čas

Čo si vyžadoval každý výsledok?

Porovnajte skóre, vykázaný súčet vstupných a výstupných tokenov a čas behu vo vybranom kole. Tokeny uvažovania sa nepripočítavajú druhýkrát. Chýbajúce merania sa vynechávajú, nezapočítavajú sa ako nula.

Zobraziť merania tokenov a času behu

Namerané výsledky

Porovnanie jednotlivých kôl.

Východiskové meranie zachováva pôvodné výsledky prvého kola aj dátumy meraní. Nasledujúci bod predstavuje nové merané kolo, nie výsledok z iného týždňa.

Zobraziť zaznamenané skóre
Skóre zo 100 bodov podľa kola
KoloClaude Opus 5 / Claude Opus 5.5Claude Sonnet 5 / Claude Sonnet 5.5Claude FableGPT-6.1 SolGPT-6 AstraGPT-6 Luna
2026-W4178.5 (Claude Opus 5.5)48.1 (Claude Sonnet 5.5)74.6 (Claude Fable)74.7 (GPT-6.1 Sol)73.5 (GPT-6 Astra)30.9 (GPT-6 Luna)
Východiskové meranie75.5 (Claude Opus 5)34.3 (Claude Sonnet 5)71.2 (Claude Fable)70.6 (GPT-6.1 Sol)77.5 (GPT-6 Astra)45.6 (GPT-6 Luna)

O benchmarku

Dajte AI 150 kvádrov. Požiadajte ju, aby vytvorila toto.

Okrúhla hlava. Zaoblená stolička. Drobná stolná lampa. Ako verne ich dokáže jazykový model vytvoriť iba z kvádrov?

Predloha: biely robot na zelenej stoličke pri okrúhlom stole s monitorom, lampou, hrnčekom a rastlinou
Socha, ktorú treba napodobniť. 56 tvarov.
kvádrov maximálne
150
modely
6
pokus na kolo
1

Ako to funguje.

Nemenné zadanie.

Každý model dostane rovnaké písomné zadanie s cieľovými rozmermi a farbami. Úplné zadanie je verejne dostupné.

Iba JSON.

Odpoveď neobsahuje nič iné: najviac 150 kvádrov s polohami, rozmermi a farbami.

Jeden pokus.

Stredná úroveň úsilia pri uvažovaní, bez nástrojov a opakovaných pokusov. Sledujeme počet tokenov a čas spracovania.

Nemenný hodnotiaci algoritmus.

Objemový prekryv s predlohou vážený podľa presnosti farieb, na stupnici od 0 do 100.

Vzorec

objemový prekryv v % × podiel správne zafarbených kociek

Merané v jednotkách 1 cm³. Odtlačok zadania 08fb5a5773fe89e7. Východisková referencia zachováva pôvodné výsledky prvého kola.

Úplná metodika a otázky

Ako to funguje

Zadanie uvádza každý tvar predlohy s presnými číselnými údajmi. Každý model odpovedá výlučne vo formáte JSON: najviac 150 kvádrov, pri každom poloha, veľkosť a jedna z 11 farieb. Samotný model nič nekreslí. Pri hodnotení výsledku vykreslíme jeho kvádre aj predlohu z rovnakých malých kociek, pri rovnakom osvetlení a z rovnakého pohľadu kamery, a obrázky zverejníme.

Skóre je objemová zhoda sochy a predlohy (pomer prieniku k zjednoteniu, meraný v kockách s hranou 1 cm) vynásobená podielom spoločných kociek so správnou farbou. Jeden kváder na každý tvar dosiahne skóre pod 40; rozdelenie každého tvaru na rovnako hrubé vrstvy dosiahne približne 50. Naklonené nohy, tenké káble a okrúhle hlavy zvýhodňujú modely, ktoré plánujú umiestnenie každého kvádra, a zobrazenie Rozdiel ukáže každú chýbajúcu, nadbytočnú aj nesprávne zafarbenú kocku.

Férové a opakovateľné

Východiskové meranie predstavuje pôvodné prvé kolo, zachované so skutočnými dátumami meraní. Pri uvedení na trh bolo vyžiadané druhé merané kolo. Zobrazené sú obe kolá; ani jedno nemá spätne upravený dátum ani nebolo vybrané ako lepší z dvoch výsledkov. Ďalšie kolá sa riadia týždenným harmonogramom.

  • Každý týždeň rovnaké zadanie, rovnaký hodnotiaci program a rovnaké nastavenia. Zadanie v3 má digitálny odtlačok 08fb5a5773fe89e7; akákoľvek zmena znamená novú verziu a nový graf.
  • Každý model odpovedá raz so strednou úrovňou úsilia pri uvažovaní prostredníctvom Claude Code alebo Codex s prihlásením cez predplatné, rovnako ako ich spúšťa VibeiDE. Bez nástrojov, bez webu, bez opakovaných pokusov a bez výberu najlepšej z N odpovedí.
  • Modely sa spúšťajú jeden po druhom, nikdy nie súbežne. Ak odpoveď nepríde do 40 minút, výsledné skóre je 0.
  • Hodnotiaci program je deterministický. Žiadny model nehodnotí iný model.

Prečítajte si celé zadanie (obyčajný text, 7,691 znakov). Názvy modelov sú aliasy, ktoré ponúka príslušný nástroj CLI; stránka zaznamenáva identifikátor modelu, ktorý nástroj CLI uviedol.

Otázky

Zhoršuje sa výkon modelov Claude alebo GPT?

Táto stránka nevidí do interného fungovania poskytovateľa, ale ukazuje, či model s rovnakým názvom dosahuje pri rovnakom nemennom zadaní v priebehu času odlišné skóre. Jeden beh za týždeň predstavuje jedinú vzorku, preto berte posun o niekoľko bodov ako šum a pokles trvajúci niekoľko týždňov ako signál.

Prečo žiadny model nedokáže dosiahnuť 100?

Predloha pozostáva z gulí, elipsoidov, valcov a naklonených kapsúl, no odpoveď môže obsahovať iba 150 kvádrov zarovnaných so súradnicovými osami. Kvádre nedokážu presne kopírovať krivky, takže v každej odpovedi časť objemu chýba. Lepšie modely využívajú kvádre tam, kde sú zakrivené tvary, a ich sochy sa viac podobajú predlohe.

Ako sa modely spúšťajú?

Každý model dostane zadanie raz prostredníctvom svojho oficiálneho nástroja príkazového riadka, Claude Code alebo Codex, s prihlásením cez bežné predplatné a strednou úrovňou úsilia pri uvažovaní. Nástroje, podagenti, prístup na web a opakované pokusy sú vypnuté; beh, ktorý použije nástroj, získa skóre 0. Odpoveď hodnotí deterministický program, nie iný model.

Prečo benchmark prešiel na v3?

Prvé dve verzie žiadali modely, aby navrhli rozloženie kancelárie. V ich prvých kolách získali najlepšie modely skóre 100 a 92 a každá správne navrhnutá kancelária vyzerala rovnako. Benchmark, v ktorom špičkové modely dosahujú maximum, nedokáže ukázať zmenu, a benchmark s podobne vyzerajúcimi odpoveďami nedokáže ukázať kvalitu. Preto v3 žiada sochu, ktorej kvalita je viditeľná na prvý pohľad.

Môžem si zadanie vyskúšať aj ja?

Áno. Úplné zadanie je verejne dostupné ako obyčajný text. Vložte ho do ľubovoľného modelu a porovnajte jeho odpoveď s predlohou.

Jazyky

Necessary cookies support sign-in, security, your language and this choice. Optional categories stay off until accepted.

First-party page views and acquisition measurement, plus Google Analytics 4 (Google Ireland, data may reach the US). Advertising personalization stays off.

With Analytics enabled, retain Google and Microsoft ad click identifiers and share download, signup, activation and purchase conversions with the relevant ad provider. No personalized advertising.

Remember referral credit for later. Links still work on the current page without this cookie.

Privacy · Cookie inventory