Kancelářský benchmark
Která AI staví nejlépe?
Šest modelů. Jedno zadání. Každý má jeden pokus. Hodnocení od 0 do 100 podle shody s přesnou předlohou.
Žebříček.
Co jednotlivé modely vytvořily.
Neupravený výstup vykreslený z JSON, který jednotlivé modely vrátily. Jeden pokus, bez opakování.
Všechny sochy mají stejné osvětlení, nastavení kamery a měřítko. Vyberte libovolný výsledek a porovnejte ho s předlohou, nebo přepněte na zobrazení Rozdíl a prohlédněte si nesrovnalosti.
Poznámky
Kvalita, tokeny a čas
Co bylo potřeba k dosažení jednotlivých výsledků?
Porovnejte skóre, vykázaný součet vstupních a výstupních tokenů a dobu běhu ve vybraném kole. Tokeny pro uvažování se znovu nepřičítají. Chybějící měření se vynechávají, nepočítají se jako nula.
Zobrazit měření tokenů a doby běhu
Naměřené výsledky
Porovnání jednotlivých kol.
Výchozí stav zachovává původní výsledky prvního kola i data měření. Další bod představuje nově změřené kolo, nikoli výsledek z jiného týdne.
Zobrazit zaznamenaná skóre
| Kolo | Claude Opus 5 / Claude Opus 5.5 | Claude Sonnet 5 / Claude Sonnet 5.5 | Claude Fable | GPT-6.1 Sol | GPT-6 Astra | GPT-6 Luna |
|---|---|---|---|---|---|---|
| 2026-W41 | 78.5 (Claude Opus 5.5) | 48.1 (Claude Sonnet 5.5) | 74.6 (Claude Fable) | 74.7 (GPT-6.1 Sol) | 73.5 (GPT-6 Astra) | 30.9 (GPT-6 Luna) |
| Výchozí stav | 75.5 (Claude Opus 5) | 34.3 (Claude Sonnet 5) | 71.2 (Claude Fable) | 70.6 (GPT-6.1 Sol) | 77.5 (GPT-6 Astra) | 45.6 (GPT-6 Luna) |
O benchmarku
Dejte AI 150 kvádrů. Požádejte ji o tohle.
Kulatá hlava. Zaoblená židle. Drobná stolní lampa. Jak věrně je dokáže jazykový model napodobit pouze pomocí kvádrů?
- kvádrů nejvýše
- 150
- modely
- 6
- pokus na kolo
- 1
Jak to funguje.
Neměnné zadání.
Každý model dostane stejné písemné zadání s cílovými rozměry a barvami. Úplné zadání je veřejně dostupné.
Pouze JSON.
Odpověď neobsahuje nic jiného: až 150 kvádrů s polohami, rozměry a barvami.
Jeden pokus.
Střední úroveň uvažování, bez nástrojů a bez opakovaných pokusů. Sledujeme počet tokenů a dobu běhu.
Neměnný hodnoticí algoritmus.
Objemový překryv s předlohou vážený podle přesnosti barev, na škále od 0 do 100.
Vzorec
objemový překryv v % × podíl správně obarvených krychlíMěřeno v jednotkách o objemu 1 cm³. Otisk zadání 08fb5a5773fe89e7. Výchozí referenční hodnoty zachovávají původní výsledky prvního kola.
Úplná metodika a otázky
Jak to funguje
Zadání uvádí všechny tvary předlohy s přesnými číselnými údaji. Každý model odpovídá pouze ve formátu JSON: nejvýše 150 kvádrů, u každého poloha, velikost a jedna z 11 barev. Model sám nic nekreslí. Při hodnocení výstupu vykreslíme jeho kvádry i předlohu ze stejných malých krychlí, se stejným osvětlením a kamerou, a obrázky zveřejníme.
Skóre se počítá jako objemový překryv sochy a předlohy (poměr průniku ke sjednocení, měřený v krychlích o hraně 1 cm) vynásobený podílem společných krychlí se správnou barvou. Použití jednoho kvádru na každý tvar přináší méně než 40 bodů; rozdělení každého tvaru na stejně silné vrstvy přináší přibližně 50 bodů. Nakloněné nohy, tenké kabely a kulaté hlavy zvýhodňují modely, které plánují umístění každého kvádru. Zobrazení Rozdíly ukazuje každou chybějící krychli, krychli navíc i krychli s nesprávnou barvou.
Férové a opakovatelné
Výchozí stav představuje původní první kolo, zachované se skutečnými daty měření. Pro spuštění bylo vyžádáno druhé měřené kolo. Zobrazují se obě kola; ani jedno nemá zpětně upravené datum a nebylo vybráno jako lepší ze dvou výsledků. Další kola probíhají podle týdenního harmonogramu.
- Každý týden stejné zadání, stejný hodnoticí program a stejné nastavení. Zadání v3 má otisk
08fb5a5773fe89e7; jakákoli změna zahajuje novou verzi a nový graf. - Každý model odpovídá jednou se střední úrovní uvažování prostřednictvím Claude Code nebo Codex s přihlášením přes předplatné, stejně jako je spouští VibeiDE. Bez nástrojů, bez webu, bez opakovaných pokusů a bez výběru nejlepšího z N výsledků.
- Modely běží postupně, nikdy souběžně. Pokud odpověď nedorazí do 40 minut, získá skóre 0.
- Hodnoticí program je deterministický. Žádný model nehodnotí jiný model.
Přečíst úplné zadání (prostý text, 7,691 znaků). Názvy modelů jsou aliasy nabízené jednotlivými CLI; stránka zaznamenává identifikátor modelu, který CLI nahlásilo.
Otázky
Zhoršuje se výkon modelů Claude nebo GPT?
Tato stránka nevidí do interního fungování poskytovatele, ale ukazuje, zda model se stejným názvem získává v průběhu času jiné skóre za stejné neměnné zadání. Jeden běh týdně představuje jediný vzorek, takže posun o několik bodů berte jako šum a pokles trvající několik týdnů jako signál.
Proč žádný model nemůže dosáhnout 100 bodů?
Předloha se skládá z koulí, elipsoidů, válců a nakloněných kapslí, ale odpověď smí použít pouze 150 kvádrů zarovnaných se souřadnicovými osami. Kvádrům se nikdy nepodaří přesně kopírovat křivky, takže každá odpověď část objemu ztrácí. Lepší modely využívají kvádry tam, kde jsou zakřivené tvary, a jejich sochy se více podobají předloze.
Jak modely spouštíte?
Každý model dostane zadání jednou prostřednictvím svého oficiálního nástroje příkazového řádku, Claude Code nebo Codex, s přihlášením přes běžné předplatné a se střední úrovní uvažování. Nástroje, dílčí agenti, přístup k webu i opakované pokusy jsou vypnuté; běh, který použije nástroj, získá 0 bodů. Odpověď hodnotí deterministický program, nikoli jiný model.
Proč benchmark přešel na v3?
První dvě verze žádaly modely o rozmístění kanceláře. V prvních kolech získaly nejlepší modely 100 a 92 bodů a všechny správně uspořádané kanceláře vypadaly stejně. Benchmark, v němž špičkové modely dosahují maxima, nedokáže ukázat vývoj, a benchmark s podobně vypadajícími odpověďmi nedokáže ukázat kvalitu. Proto v3 žádá o sochu, jejíž kvalita je patrná na první pohled.
Mohu si zadání vyzkoušet?
Ano. Úplné zadání je veřejně dostupné jako prostý text. Vložte ho do libovolného modelu a porovnejte jeho odpověď s předlohou.