Канцеларијски бенчмарк
Који AI најбоље гради?
Шест модела. Један задатак. По један покушај. Оцене од 0 до 100 према тачно задатом циљу.
Ранг-листа.
Шта је сваки модел направио.
Необрађени резултат, приказан на основу JSON-а који је сваки модел вратио. Један покушај, без понављања.
Све скулптуре приказане су уз исто осветљење, камеру и размеру. Изаберите било који резултат да бисте га упоредили са циљем или пређите на приказ Разлика да бисте испитали одступања.
Напомене
Квалитет, токени и време
Колико је ресурса захтевао сваки резултат?
Упоредите оцену, пријављени збир улазних и излазних токена и укупно време извршавања за изабрану рунду. Токени за резоновање не додају се поново. Мерења која недостају изостављају се и не рачунају се као нула.
Погледајте мерења броја токена и времена извршавања
Измерени резултати
Из рунде у рунду.
Почетне референтне вредности чувају изворне резултате прве рунде и датуме мерења. Следећа тачка представља нову измерену рунду, а не резултат из неке друге недеље.
Погледајте забележене оцене
| Рунда | Claude Opus 5 / Claude Opus 5.5 | Claude Sonnet 5 / Claude Sonnet 5.5 | Claude Fable | GPT-6.1 Sol | GPT-6 Astra | GPT-6 Luna |
|---|---|---|---|---|---|---|
| 2026-W41 | 78.5 (Claude Opus 5.5) | 48.1 (Claude Sonnet 5.5) | 74.6 (Claude Fable) | 74.7 (GPT-6.1 Sol) | 73.5 (GPT-6 Astra) | 30.9 (GPT-6 Luna) |
| Почетне референтне вредности | 75.5 (Claude Opus 5) | 34.3 (Claude Sonnet 5) | 71.2 (Claude Fable) | 70.6 (GPT-6.1 Sol) | 77.5 (GPT-6 Astra) | 45.6 (GPT-6 Luna) |
О бенчмарку
Дајте AI-ју 150 квадара. Затражите ово.
Округла глава. Закривљена столица. Мала стона лампа. Колико верно језички модел може да ово дочара користећи само правоугаоне блокове?
- блокова највише
- 150
- модела
- 6
- покушај по рунди
- 1
Како функционише.
Непроменљив опис задатка.
Сваки модел добија исти писани опис задатка са задатим димензијама и бојама. Цео опис је јавно доступан.
Само JSON.
Одговор не садржи ништа друго: до 150 квадара са положајима, димензијама и бојама.
Један покушај.
Средњи ниво напора при расуђивању, без алата и без поновних покушаја. Прате се број токена и време извршавања.
Непроменљив систем оцењивања.
Запреминско преклапање са циљним обликом, пондерисано тачношћу боја, од 0 до 100.
Формула
запреминско преклапање % × удео коцки са исправном бојомМери се у јединицама од 1 cm³. Дигитални отисак описа задатка 08fb5a5773fe89e7. Почетна референтна основа чува изворне резултате прве рунде.
Комплетна методологија и питања
Како функционише
У задатку је наведен сваки облик задатог узора са тачним бројчаним вредностима. Сваки модел одговара искључиво у JSON формату: до 150 квадара, за сваки са положајем, димензијама и једном од 11 боја. Модел сам ништа не црта. Када оцењујемо резултат, рендерујемо његове квадре и задати узор помоћу истих малих коцкица, уз исто осветљење и камеру, и објављујемо слике.
Оцена је запреминско преклапање скулптуре и задатог модела (однос пресека и уније, мерен коцкицама величине 1 cm) помножено уделом заједничких коцкица исправне боје. Један квадар по облику доноси оцену испод 40; подела сваког облика на једнаке слојеве доноси око 50. Косе ноге, танки каблови и округле главе доносе више бодова моделима који планирају положај сваког квадра, а приказ Разлика показује сваку недостајућу, сувишну и погрешно обојену коцкицу.
Поштено и поновљиво
Почетне референтне вредности потичу из изворне прве рунде, сачуване са стварним датумима мерења. За лансирање је затражена друга рунда мерења. Приказане су обе; ниједној нису накнадно приписани ранији датуми нити је изабрана као бољи од два резултата. Наредне рунде прате недељни распоред.
- Исти задатак, исти програм за оцењивање и иста подешавања сваке недеље. Задатак v3 има дигитални отисак
08fb5a5773fe89e7; свака промена покреће нову верзију и нови графикон. - Сваки модел одговара једном, уз средњи ниво напора при резоновању, преко Claude Code или Codex алата пријављеног са претплатом, на исти начин на који их VibeiDE покреће. Без алата, без веба, без поновних покушаја и без избора најбољег од N одговора.
- Модели се покрећу један за другим, никада паралелно. Одговор који не стигне у року од 40 минута добија оцену 0.
- Програм за оцењивање је детерминистички. Ниједан модел не оцењује други модел.
Прочитајте цео задатак (обичан текст, 7,691 знакова). Називи модела су алијаси које сваки CLI нуди; страница бележи идентификатор модела који је CLI пријавио.
Питања
Да ли Claude или GPT постају слабији?
Ова страница нема увид у интерне промене код добављача, али показује да ли модел са истим називом временом добија различите оцене на истом непроменљивом задатку. Једно покретање недељно представља само један узорак, па промену од неколико поена посматрајте као шум, а пад који траје неколико недеља као сигнал.
Зашто ниједан модел не може да достигне 100?
Задати модел чине сфере, елипсоиди, цилиндри и косо постављене капсуле, а одговор сме да користи само 150 квадара поравнатих са координатним осама. Квадри не могу тачно да прате кривине, па се у сваком одговору губи део запремине. Бољи модели користе своје квадре тамо где су кривине, па њихове скулптуре више личе на задати модел.
Како се модели покрећу?
Сваки модел добија задатак једном, преко свог званичног алата командне линије, Claude Code или Codex, уз пријаву са уобичајеном претплатом и средњи ниво напора у резоновању. Алати, подагенти, приступ вебу и поновни покушаји су искључени; извршавање у којем се употреби алат добија оцену 0. Одговор оцењује детерминистички програм, а не други модел.
Зашто је тест прешао на v3?
У прве две верзије модели су добијали задатак да осмисле распоред канцеларије. У првим круговима најбољи модели добили су 100 и 92, а све исправно уређене канцеларије изгледале су исто. Тест на којем најбољи модели достижу максимум не може да покаже промену, а тест на којем одговори личе један на други не може да покаже квалитет, па v3 тражи скулптуру чији се квалитет види на први поглед.
Могу ли и сам да испробам задатак?
Да. Цео задатак је јавно доступан као обичан текст. Налепите га у било који модел и упоредите његов одговор са задатим моделом.