Офис бенчмарк
Кой AI изгражда най-добре?
Шест модела. Едно задание. По един опит. Оценка от 0 до 100 според съответствието с точния образец.
Класиране.
Какво изгради всеки модел.
Необработеният резултат, визуализиран от JSON, върнат от всеки модел. Един опит, без повторения.
Всички скулптури са показани с еднакво осветление, камера и мащаб. Изберете резултат, за да го сравните с образеца, или превключете на „Разлика“, за да разгледате несъответствията.
Бележки
Качество, токени и време
Какви ресурси бяха необходими за всеки резултат?
Сравнете оценката, отчетения общ брой входни и изходни токени и времето за изпълнение за избрания рунд. Токените за разсъждение не се добавят повторно. Липсващите измервания се изключват, а не се отчитат като нула.
Вижте измерванията за токените и времето за изпълнение
Измерени резултати
От кръг на кръг.
Началните референтни резултати запазват оригиналните резултати от първия рунд и датите на измерванията. Следващата точка е нов рунд с измерени резултати, а не резултат от друга седмица.
Вижте записаните оценки
| Рунд | Claude Opus 5 / Claude Opus 5.5 | Claude Sonnet 5 / Claude Sonnet 5.5 | Claude Fable | GPT-6.1 Sol | GPT-6 Astra | GPT-6 Luna |
|---|---|---|---|---|---|---|
| 2026-W41 | 78.5 (Claude Opus 5.5) | 48.1 (Claude Sonnet 5.5) | 74.6 (Claude Fable) | 74.7 (GPT-6.1 Sol) | 73.5 (GPT-6 Astra) | 30.9 (GPT-6 Luna) |
| Начални референтни резултати | 75.5 (Claude Opus 5) | 34.3 (Claude Sonnet 5) | 71.2 (Claude Fable) | 70.6 (GPT-6.1 Sol) | 77.5 (GPT-6 Astra) | 45.6 (GPT-6 Luna) |
За бенчмарка
Дайте на AI 150 правоъгълни блока. Поискайте да изгради това.
Кръгла глава. Извит стол. Миниатюрна настолна лампа. Колко близо може да се доближи един езиков модел само с правоъгълни блокове?
- блока максимум
- 150
- модела
- 6
- опит на рунд
- 1
Как работи.
Фиксирано задание.
Всеки модел получава едно и също писмено задание с размерите и цветовете на образеца. Пълното задание е публично достъпно.
Само JSON.
Отговорът не съдържа нищо друго: до 150 правоъгълни блока с позиции, размери и цветове.
Един опит.
Средно ниво на усилие за разсъждение, без инструменти и без повторни опити. Следят се броят на токените и времето за изпълнение.
Фиксиран алгоритъм за оценяване.
Обемно припокриване с образеца, претеглено според точността на цветовете, с оценка от 0 до 100.
Формулата
обемно припокриване в % × дял на кубчетата с правилен цвятИзмерва се в единици от 1 cm³. Отпечатък на заданието 08fb5a5773fe89e7. Началната база за сравнение запазва оригиналните резултати от първия кръг.
Пълна методология и въпроси
Как работи
Заданието описва всяка форма на образеца с точни числови стойности. Всеки модел отговаря само с JSON: до 150 правоъгълни блока, всеки с позиция, размер и един от 11 цвята. Самият модел не рисува нищо. При оценяването на дадено изпълнение визуализираме блоковете му и образеца с едни и същи малки кубчета, при еднакво осветление и положение на камерата, и публикуваме изображенията.
Оценката е обемното припокриване между скулптурата и образеца (отношението на сечението към обединението, измерено с кубчета с размер 1 cm), умножено по дела на общите кубчета с правилния цвят. Използването на един блок за всяка форма дава оценка под 40; разделянето на всяка форма на равни слоеве дава оценка около 50. Наклонените крака, тънките кабели и кръглите глави носят повече точки на моделите, които планират къде да поставят всеки блок, а изгледът „Разлика“ показва всяко липсващо, излишно или неправилно оцветено кубче.
Справедлив и възпроизводим
Началните референтни резултати са от оригиналния първи рунд и са запазени с действителните дати на измерванията. За старта беше поискан втори рунд с измерени резултати. Показани са и двата рунда; нито един не е датиран със задна дата или избран като най-добрия от двата. Следващите рундове се провеждат по седмичния график.
- Всяка седмица се използват едно и също задание, една и съща програма за оценяване и едни и същи настройки. Задание v3 има цифров отпечатък
08fb5a5773fe89e7; всяка промяна започва нова версия и нова графика. - Всеки модел отговаря веднъж със средно ниво на усилие за разсъждение чрез Claude Code или Codex с вход чрез абонамент, по същия начин, по който ги изпълнява VibeiDE. Без инструменти, без интернет, без повторни опити и без избор на най-добрия от N отговора.
- Моделите се изпълняват един след друг, никога паралелно. Ако отговорът не пристигне в рамките на 40 минути, оценката е 0.
- Оценяващата програма е детерминистична. Никой модел не оценява друг модел.
Прочетете пълното задание (обикновен текст, 7,691 знака). Имената на моделите са псевдонимите, предлагани от съответния CLI; страницата записва идентификатора на модела, отчетен от CLI.
Въпроси
Намаляват ли се възможностите на Claude или GPT?
Тази страница няма достъп до вътрешните процеси на доставчика, но показва дали модел с едно и също име получава различни оценки по една и съща фиксирана задача с течение на времето. Едно изпълнение седмично е само единично наблюдение, затова приемайте промяна от няколко точки за шум, а спад, който се задържа няколко седмици, за сигнал.
Защо никой модел не може да достигне 100?
Образецът е изграден от сфери, елипсоиди, цилиндри и наклонени капсули, а отговорът може да използва само 150 правоъгълни блока, подравнени по координатните оси. Блоковете не могат да следват кривите точно, затова във всеки отговор се губи част от обема. По-добрите модели използват блоковете си там, където са кривите, и скулптурите им приличат повече на образеца.
Как се изпълняват моделите?
Всеки модел получава заданието веднъж чрез официалния си инструмент за командния ред, Claude Code или Codex, с вход чрез стандартен абонамент и средно ниво на усилие за разсъждение. Инструментите, подагентите, достъпът до интернет и повторните опити са изключени; изпълнение, което използва инструмент, получава оценка 0. Отговорът се оценява от детерминистична програма, а не от друг модел.
Защо тестът премина към v3?
Първите две версии изискваха от моделите да подредят офис. В първите им кръгове най-добрите модели получиха оценки 100 и 92, а всички правилно подредени офиси изглеждаха еднакво. Тест, в който водещите модели достигат максималната оценка, не може да покаже напредък, а тест с еднакво изглеждащи отговори не може да покаже качество. Затова v3 изисква скулптура, чието качество се вижда от пръв поглед.
Мога ли да изпробвам заданието самостоятелно?
Да. Пълното задание е публично достъпно като обикновен текст. Поставете го в който и да е модел и сравнете отговора му с образеца.