Канцеларијски бенчмарк

Који AI најбоље гради?

Шест модела. Један задатак. По један покушај. Оцене од 0 до 100 према тачно задатом циљу.

Ранг-листа.

Шта је сваки модел направио.

Необрађени резултат, приказан на основу JSON-а који је сваки модел вратио. Један покушај, без понављања.

Недеља 2026-W41

Све скулптуре приказане су уз исто осветљење, камеру и размеру. Изаберите било који резултат да бисте га упоредили са циљем или пређите на приказ Разлика да бисте испитали одступања.

  1. Claude Opus 5.578.5/100Скулптура модела Claude Opus 5.5
  2. GPT-6.1 Sol74.7/100Скулптура модела GPT-6.1 Sol
  3. Claude Fable74.6/100Скулптура модела Claude Fable
  4. GPT-6 Astra73.5/100Скулптура модела GPT-6 Astra
  5. Claude Sonnet 5.548.1/100Скулптура модела Claude Sonnet 5.5
  6. GPT-6 Luna30.9/100Скулптура модела GPT-6 Luna

Квалитет, токени и време

Колико је ресурса захтевао сваки резултат?

Упоредите оцену, пријављени збир улазних и излазних токена и укупно време извршавања за изабрану рунду. Токени за резоновање не додају се поново. Мерења која недостају изостављају се и не рачунају се као нула.

Погледајте мерења броја токена и времена извршавања

Измерени резултати

Из рунде у рунду.

Почетне референтне вредности чувају изворне резултате прве рунде и датуме мерења. Следећа тачка представља нову измерену рунду, а не резултат из неке друге недеље.

Погледајте забележене оцене
Оцена на скали до 100 по рундама
РундаClaude Opus 5 / Claude Opus 5.5Claude Sonnet 5 / Claude Sonnet 5.5Claude FableGPT-6.1 SolGPT-6 AstraGPT-6 Luna
2026-W4178.5 (Claude Opus 5.5)48.1 (Claude Sonnet 5.5)74.6 (Claude Fable)74.7 (GPT-6.1 Sol)73.5 (GPT-6 Astra)30.9 (GPT-6 Luna)
Почетне референтне вредности75.5 (Claude Opus 5)34.3 (Claude Sonnet 5)71.2 (Claude Fable)70.6 (GPT-6.1 Sol)77.5 (GPT-6 Astra)45.6 (GPT-6 Luna)

О бенчмарку

Дајте AI-ју 150 квадара. Затражите ово.

Округла глава. Закривљена столица. Мала стона лампа. Колико верно језички модел може да ово дочара користећи само правоугаоне блокове?

Циљ: бели робот на зеленој столици за округлим столом са монитором, лампом, шољом и биљком
Скулптура коју треба поново направити. 56 облика.
блокова највише
150
модела
6
покушај по рунди
1

Како функционише.

Непроменљив опис задатка.

Сваки модел добија исти писани опис задатка са задатим димензијама и бојама. Цео опис је јавно доступан.

Само JSON.

Одговор не садржи ништа друго: до 150 квадара са положајима, димензијама и бојама.

Један покушај.

Средњи ниво напора при расуђивању, без алата и без поновних покушаја. Прате се број токена и време извршавања.

Непроменљив систем оцењивања.

Запреминско преклапање са циљним обликом, пондерисано тачношћу боја, од 0 до 100.

Формула

запреминско преклапање % × удео коцки са исправном бојом

Мери се у јединицама од 1 cm³. Дигитални отисак описа задатка 08fb5a5773fe89e7. Почетна референтна основа чува изворне резултате прве рунде.

Комплетна методологија и питања

Како функционише

У задатку је наведен сваки облик задатог узора са тачним бројчаним вредностима. Сваки модел одговара искључиво у JSON формату: до 150 квадара, за сваки са положајем, димензијама и једном од 11 боја. Модел сам ништа не црта. Када оцењујемо резултат, рендерујемо његове квадре и задати узор помоћу истих малих коцкица, уз исто осветљење и камеру, и објављујемо слике.

Оцена је запреминско преклапање скулптуре и задатог модела (однос пресека и уније, мерен коцкицама величине 1 cm) помножено уделом заједничких коцкица исправне боје. Један квадар по облику доноси оцену испод 40; подела сваког облика на једнаке слојеве доноси око 50. Косе ноге, танки каблови и округле главе доносе више бодова моделима који планирају положај сваког квадра, а приказ Разлика показује сваку недостајућу, сувишну и погрешно обојену коцкицу.

Поштено и поновљиво

Почетне референтне вредности потичу из изворне прве рунде, сачуване са стварним датумима мерења. За лансирање је затражена друга рунда мерења. Приказане су обе; ниједној нису накнадно приписани ранији датуми нити је изабрана као бољи од два резултата. Наредне рунде прате недељни распоред.

  • Исти задатак, исти програм за оцењивање и иста подешавања сваке недеље. Задатак v3 има дигитални отисак 08fb5a5773fe89e7; свака промена покреће нову верзију и нови графикон.
  • Сваки модел одговара једном, уз средњи ниво напора при резоновању, преко Claude Code или Codex алата пријављеног са претплатом, на исти начин на који их VibeiDE покреће. Без алата, без веба, без поновних покушаја и без избора најбољег од N одговора.
  • Модели се покрећу један за другим, никада паралелно. Одговор који не стигне у року од 40 минута добија оцену 0.
  • Програм за оцењивање је детерминистички. Ниједан модел не оцењује други модел.

Прочитајте цео задатак (обичан текст, 7,691 знакова). Називи модела су алијаси које сваки CLI нуди; страница бележи идентификатор модела који је CLI пријавио.

Питања

Да ли Claude или GPT постају слабији?

Ова страница нема увид у интерне промене код добављача, али показује да ли модел са истим називом временом добија различите оцене на истом непроменљивом задатку. Једно покретање недељно представља само један узорак, па промену од неколико поена посматрајте као шум, а пад који траје неколико недеља као сигнал.

Зашто ниједан модел не може да достигне 100?

Задати модел чине сфере, елипсоиди, цилиндри и косо постављене капсуле, а одговор сме да користи само 150 квадара поравнатих са координатним осама. Квадри не могу тачно да прате кривине, па се у сваком одговору губи део запремине. Бољи модели користе своје квадре тамо где су кривине, па њихове скулптуре више личе на задати модел.

Како се модели покрећу?

Сваки модел добија задатак једном, преко свог званичног алата командне линије, Claude Code или Codex, уз пријаву са уобичајеном претплатом и средњи ниво напора у резоновању. Алати, подагенти, приступ вебу и поновни покушаји су искључени; извршавање у којем се употреби алат добија оцену 0. Одговор оцењује детерминистички програм, а не други модел.

Зашто је тест прешао на v3?

У прве две верзије модели су добијали задатак да осмисле распоред канцеларије. У првим круговима најбољи модели добили су 100 и 92, а све исправно уређене канцеларије изгледале су исто. Тест на којем најбољи модели достижу максимум не може да покаже промену, а тест на којем одговори личе један на други не може да покаже квалитет, па v3 тражи скулптуру чији се квалитет види на први поглед.

Могу ли и сам да испробам задатак?

Да. Цео задатак је јавно доступан као обичан текст. Налепите га у било који модел и упоредите његов одговор са задатим моделом.

Језици

Necessary cookies support sign-in, security, your language and this choice. Optional categories stay off until accepted.

First-party page views and acquisition measurement, plus Google Analytics 4 (Google Ireland, data may reach the US). Advertising personalization stays off.

With Analytics enabled, retain Google and Microsoft ad click identifiers and share download, signup, activation and purchase conversions with the relevant ad provider. No personalized advertising.

Remember referral credit for later. Links still work on the current page without this cookie.

Privacy · Cookie inventory