Офис бенчмарк

Кой AI изгражда най-добре?

Шест модела. Едно задание. По един опит. Оценка от 0 до 100 според съответствието с точния образец.

Класиране.

Какво изгради всеки модел.

Необработеният резултат, визуализиран от JSON, върнат от всеки модел. Един опит, без повторения.

Седмица 2026-W41

Всички скулптури са показани с еднакво осветление, камера и мащаб. Изберете резултат, за да го сравните с образеца, или превключете на „Разлика“, за да разгледате несъответствията.

  1. Claude Opus 5.578.5/100Скулптура на Claude Opus 5.5
  2. GPT-6.1 Sol74.7/100Скулптура на GPT-6.1 Sol
  3. Claude Fable74.6/100Скулптура на Claude Fable
  4. GPT-6 Astra73.5/100Скулптура на GPT-6 Astra
  5. Claude Sonnet 5.548.1/100Скулптура на Claude Sonnet 5.5
  6. GPT-6 Luna30.9/100Скулптура на GPT-6 Luna

Качество, токени и време

Какви ресурси бяха необходими за всеки резултат?

Сравнете оценката, отчетения общ брой входни и изходни токени и времето за изпълнение за избрания рунд. Токените за разсъждение не се добавят повторно. Липсващите измервания се изключват, а не се отчитат като нула.

Вижте измерванията за токените и времето за изпълнение

Измерени резултати

От кръг на кръг.

Началните референтни резултати запазват оригиналните резултати от първия рунд и датите на измерванията. Следващата точка е нов рунд с измерени резултати, а не резултат от друга седмица.

Вижте записаните оценки
Оценка от 100 по рундове
РундClaude Opus 5 / Claude Opus 5.5Claude Sonnet 5 / Claude Sonnet 5.5Claude FableGPT-6.1 SolGPT-6 AstraGPT-6 Luna
2026-W4178.5 (Claude Opus 5.5)48.1 (Claude Sonnet 5.5)74.6 (Claude Fable)74.7 (GPT-6.1 Sol)73.5 (GPT-6 Astra)30.9 (GPT-6 Luna)
Начални референтни резултати75.5 (Claude Opus 5)34.3 (Claude Sonnet 5)71.2 (Claude Fable)70.6 (GPT-6.1 Sol)77.5 (GPT-6 Astra)45.6 (GPT-6 Luna)

За бенчмарка

Дайте на AI 150 правоъгълни блока. Поискайте да изгради това.

Кръгла глава. Извит стол. Миниатюрна настолна лампа. Колко близо може да се доближи един езиков модел само с правоъгълни блокове?

Образецът: бял робот на зелен стол пред кръгло бюро с монитор, лампа, чаша и растение
Скулптурата за пресъздаване. 56 форми.
блока максимум
150
модела
6
опит на рунд
1

Как работи.

Фиксирано задание.

Всеки модел получава едно и също писмено задание с размерите и цветовете на образеца. Пълното задание е публично достъпно.

Само JSON.

Отговорът не съдържа нищо друго: до 150 правоъгълни блока с позиции, размери и цветове.

Един опит.

Средно ниво на усилие за разсъждение, без инструменти и без повторни опити. Следят се броят на токените и времето за изпълнение.

Фиксиран алгоритъм за оценяване.

Обемно припокриване с образеца, претеглено според точността на цветовете, с оценка от 0 до 100.

Формулата

обемно припокриване в % × дял на кубчетата с правилен цвят

Измерва се в единици от 1 cm³. Отпечатък на заданието 08fb5a5773fe89e7. Началната база за сравнение запазва оригиналните резултати от първия кръг.

Пълна методология и въпроси

Как работи

Заданието описва всяка форма на образеца с точни числови стойности. Всеки модел отговаря само с JSON: до 150 правоъгълни блока, всеки с позиция, размер и един от 11 цвята. Самият модел не рисува нищо. При оценяването на дадено изпълнение визуализираме блоковете му и образеца с едни и същи малки кубчета, при еднакво осветление и положение на камерата, и публикуваме изображенията.

Оценката е обемното припокриване между скулптурата и образеца (отношението на сечението към обединението, измерено с кубчета с размер 1 cm), умножено по дела на общите кубчета с правилния цвят. Използването на един блок за всяка форма дава оценка под 40; разделянето на всяка форма на равни слоеве дава оценка около 50. Наклонените крака, тънките кабели и кръглите глави носят повече точки на моделите, които планират къде да поставят всеки блок, а изгледът „Разлика“ показва всяко липсващо, излишно или неправилно оцветено кубче.

Справедлив и възпроизводим

Началните референтни резултати са от оригиналния първи рунд и са запазени с действителните дати на измерванията. За старта беше поискан втори рунд с измерени резултати. Показани са и двата рунда; нито един не е датиран със задна дата или избран като най-добрия от двата. Следващите рундове се провеждат по седмичния график.

  • Всяка седмица се използват едно и също задание, една и съща програма за оценяване и едни и същи настройки. Задание v3 има цифров отпечатък 08fb5a5773fe89e7; всяка промяна започва нова версия и нова графика.
  • Всеки модел отговаря веднъж със средно ниво на усилие за разсъждение чрез Claude Code или Codex с вход чрез абонамент, по същия начин, по който ги изпълнява VibeiDE. Без инструменти, без интернет, без повторни опити и без избор на най-добрия от N отговора.
  • Моделите се изпълняват един след друг, никога паралелно. Ако отговорът не пристигне в рамките на 40 минути, оценката е 0.
  • Оценяващата програма е детерминистична. Никой модел не оценява друг модел.

Прочетете пълното задание (обикновен текст, 7,691 знака). Имената на моделите са псевдонимите, предлагани от съответния CLI; страницата записва идентификатора на модела, отчетен от CLI.

Въпроси

Намаляват ли се възможностите на Claude или GPT?

Тази страница няма достъп до вътрешните процеси на доставчика, но показва дали модел с едно и също име получава различни оценки по една и съща фиксирана задача с течение на времето. Едно изпълнение седмично е само единично наблюдение, затова приемайте промяна от няколко точки за шум, а спад, който се задържа няколко седмици, за сигнал.

Защо никой модел не може да достигне 100?

Образецът е изграден от сфери, елипсоиди, цилиндри и наклонени капсули, а отговорът може да използва само 150 правоъгълни блока, подравнени по координатните оси. Блоковете не могат да следват кривите точно, затова във всеки отговор се губи част от обема. По-добрите модели използват блоковете си там, където са кривите, и скулптурите им приличат повече на образеца.

Как се изпълняват моделите?

Всеки модел получава заданието веднъж чрез официалния си инструмент за командния ред, Claude Code или Codex, с вход чрез стандартен абонамент и средно ниво на усилие за разсъждение. Инструментите, подагентите, достъпът до интернет и повторните опити са изключени; изпълнение, което използва инструмент, получава оценка 0. Отговорът се оценява от детерминистична програма, а не от друг модел.

Защо тестът премина към v3?

Първите две версии изискваха от моделите да подредят офис. В първите им кръгове най-добрите модели получиха оценки 100 и 92, а всички правилно подредени офиси изглеждаха еднакво. Тест, в който водещите модели достигат максималната оценка, не може да покаже напредък, а тест с еднакво изглеждащи отговори не може да покаже качество. Затова v3 изисква скулптура, чието качество се вижда от пръв поглед.

Мога ли да изпробвам заданието самостоятелно?

Да. Пълното задание е публично достъпно като обикновен текст. Поставете го в който и да е модел и сравнете отговора му с образеца.

Езици

Necessary cookies support sign-in, security, your language and this choice. Optional categories stay off until accepted.

First-party page views and acquisition measurement, plus Google Analytics 4 (Google Ireland, data may reach the US). Advertising personalization stays off.

With Analytics enabled, retain Google and Microsoft ad click identifiers and share download, signup, activation and purchase conversions with the relevant ad provider. No personalized advertising.

Remember referral credit for later. Links still work on the current page without this cookie.

Privacy · Cookie inventory