Kancelářský benchmark

Která AI staví nejlépe?

Šest modelů. Jedno zadání. Každý má jeden pokus. Hodnocení od 0 do 100 podle shody s přesnou předlohou.

Žebříček.

Co jednotlivé modely vytvořily.

Neupravený výstup vykreslený z JSON, který jednotlivé modely vrátily. Jeden pokus, bez opakování.

Týden 2026-W41

Všechny sochy mají stejné osvětlení, nastavení kamery a měřítko. Vyberte libovolný výsledek a porovnejte ho s předlohou, nebo přepněte na zobrazení Rozdíl a prohlédněte si nesrovnalosti.

  1. Claude Opus 5.578.5/100Socha od Claude Opus 5.5
  2. GPT-6.1 Sol74.7/100Socha od GPT-6.1 Sol
  3. Claude Fable74.6/100Socha od Claude Fable
  4. GPT-6 Astra73.5/100Socha od GPT-6 Astra
  5. Claude Sonnet 5.548.1/100Socha od Claude Sonnet 5.5
  6. GPT-6 Luna30.9/100Socha od GPT-6 Luna

Kvalita, tokeny a čas

Co bylo potřeba k dosažení jednotlivých výsledků?

Porovnejte skóre, vykázaný součet vstupních a výstupních tokenů a dobu běhu ve vybraném kole. Tokeny pro uvažování se znovu nepřičítají. Chybějící měření se vynechávají, nepočítají se jako nula.

Zobrazit měření tokenů a doby běhu

Naměřené výsledky

Porovnání jednotlivých kol.

Výchozí stav zachovává původní výsledky prvního kola i data měření. Další bod představuje nově změřené kolo, nikoli výsledek z jiného týdne.

Zobrazit zaznamenaná skóre
Skóre ze 100 bodů podle kol
KoloClaude Opus 5 / Claude Opus 5.5Claude Sonnet 5 / Claude Sonnet 5.5Claude FableGPT-6.1 SolGPT-6 AstraGPT-6 Luna
2026-W4178.5 (Claude Opus 5.5)48.1 (Claude Sonnet 5.5)74.6 (Claude Fable)74.7 (GPT-6.1 Sol)73.5 (GPT-6 Astra)30.9 (GPT-6 Luna)
Výchozí stav75.5 (Claude Opus 5)34.3 (Claude Sonnet 5)71.2 (Claude Fable)70.6 (GPT-6.1 Sol)77.5 (GPT-6 Astra)45.6 (GPT-6 Luna)

O benchmarku

Dejte AI 150 kvádrů. Požádejte ji o tohle.

Kulatá hlava. Zaoblená židle. Drobná stolní lampa. Jak věrně je dokáže jazykový model napodobit pouze pomocí kvádrů?

Předloha: bílý robot na zelené židli u kulatého stolu s monitorem, lampou, hrnkem a rostlinou
Předloha pro vytvoření sochy. 56 tvarů.
kvádrů nejvýše
150
modely
6
pokus na kolo
1

Jak to funguje.

Neměnné zadání.

Každý model dostane stejné písemné zadání s cílovými rozměry a barvami. Úplné zadání je veřejně dostupné.

Pouze JSON.

Odpověď neobsahuje nic jiného: až 150 kvádrů s polohami, rozměry a barvami.

Jeden pokus.

Střední úroveň uvažování, bez nástrojů a bez opakovaných pokusů. Sledujeme počet tokenů a dobu běhu.

Neměnný hodnoticí algoritmus.

Objemový překryv s předlohou vážený podle přesnosti barev, na škále od 0 do 100.

Vzorec

objemový překryv v % × podíl správně obarvených krychlí

Měřeno v jednotkách o objemu 1 cm³. Otisk zadání 08fb5a5773fe89e7. Výchozí referenční hodnoty zachovávají původní výsledky prvního kola.

Úplná metodika a otázky

Jak to funguje

Zadání uvádí všechny tvary předlohy s přesnými číselnými údaji. Každý model odpovídá pouze ve formátu JSON: nejvýše 150 kvádrů, u každého poloha, velikost a jedna z 11 barev. Model sám nic nekreslí. Při hodnocení výstupu vykreslíme jeho kvádry i předlohu ze stejných malých krychlí, se stejným osvětlením a kamerou, a obrázky zveřejníme.

Skóre se počítá jako objemový překryv sochy a předlohy (poměr průniku ke sjednocení, měřený v krychlích o hraně 1 cm) vynásobený podílem společných krychlí se správnou barvou. Použití jednoho kvádru na každý tvar přináší méně než 40 bodů; rozdělení každého tvaru na stejně silné vrstvy přináší přibližně 50 bodů. Nakloněné nohy, tenké kabely a kulaté hlavy zvýhodňují modely, které plánují umístění každého kvádru. Zobrazení Rozdíly ukazuje každou chybějící krychli, krychli navíc i krychli s nesprávnou barvou.

Férové a opakovatelné

Výchozí stav představuje původní první kolo, zachované se skutečnými daty měření. Pro spuštění bylo vyžádáno druhé měřené kolo. Zobrazují se obě kola; ani jedno nemá zpětně upravené datum a nebylo vybráno jako lepší ze dvou výsledků. Další kola probíhají podle týdenního harmonogramu.

  • Každý týden stejné zadání, stejný hodnoticí program a stejné nastavení. Zadání v3 má otisk 08fb5a5773fe89e7; jakákoli změna zahajuje novou verzi a nový graf.
  • Každý model odpovídá jednou se střední úrovní uvažování prostřednictvím Claude Code nebo Codex s přihlášením přes předplatné, stejně jako je spouští VibeiDE. Bez nástrojů, bez webu, bez opakovaných pokusů a bez výběru nejlepšího z N výsledků.
  • Modely běží postupně, nikdy souběžně. Pokud odpověď nedorazí do 40 minut, získá skóre 0.
  • Hodnoticí program je deterministický. Žádný model nehodnotí jiný model.

Přečíst úplné zadání (prostý text, 7,691 znaků). Názvy modelů jsou aliasy nabízené jednotlivými CLI; stránka zaznamenává identifikátor modelu, který CLI nahlásilo.

Otázky

Zhoršuje se výkon modelů Claude nebo GPT?

Tato stránka nevidí do interního fungování poskytovatele, ale ukazuje, zda model se stejným názvem získává v průběhu času jiné skóre za stejné neměnné zadání. Jeden běh týdně představuje jediný vzorek, takže posun o několik bodů berte jako šum a pokles trvající několik týdnů jako signál.

Proč žádný model nemůže dosáhnout 100 bodů?

Předloha se skládá z koulí, elipsoidů, válců a nakloněných kapslí, ale odpověď smí použít pouze 150 kvádrů zarovnaných se souřadnicovými osami. Kvádrům se nikdy nepodaří přesně kopírovat křivky, takže každá odpověď část objemu ztrácí. Lepší modely využívají kvádry tam, kde jsou zakřivené tvary, a jejich sochy se více podobají předloze.

Jak modely spouštíte?

Každý model dostane zadání jednou prostřednictvím svého oficiálního nástroje příkazového řádku, Claude Code nebo Codex, s přihlášením přes běžné předplatné a se střední úrovní uvažování. Nástroje, dílčí agenti, přístup k webu i opakované pokusy jsou vypnuté; běh, který použije nástroj, získá 0 bodů. Odpověď hodnotí deterministický program, nikoli jiný model.

Proč benchmark přešel na v3?

První dvě verze žádaly modely o rozmístění kanceláře. V prvních kolech získaly nejlepší modely 100 a 92 bodů a všechny správně uspořádané kanceláře vypadaly stejně. Benchmark, v němž špičkové modely dosahují maxima, nedokáže ukázat vývoj, a benchmark s podobně vypadajícími odpověďmi nedokáže ukázat kvalitu. Proto v3 žádá o sochu, jejíž kvalita je patrná na první pohled.

Mohu si zadání vyzkoušet?

Ano. Úplné zadání je veřejně dostupné jako prostý text. Vložte ho do libovolného modelu a porovnejte jeho odpověď s předlohou.

Jazyky

Necessary cookies support sign-in, security, your language and this choice. Optional categories stay off until accepted.

First-party page views and acquisition measurement, plus Google Analytics 4 (Google Ireland, data may reach the US). Advertising personalization stays off.

With Analytics enabled, retain Google and Microsoft ad click identifiers and share download, signup, activation and purchase conversions with the relevant ad provider. No personalized advertising.

Remember referral credit for later. Links still work on the current page without this cookie.

Privacy · Cookie inventory