Офисный бенчмарк

Какой ИИ строит лучше?

Шесть моделей. Одно задание. По одной попытке. Оценка от 0 до 100 за точность воспроизведения образца.

Таблица лидеров.

Что построила каждая модель.

Исходный результат, визуализированный по JSON, который вернула каждая модель. Одна попытка, без повторов.

Неделя 2026-W41

Для всех скульптур используются одинаковые освещение, камера и масштаб. Выберите любой результат, чтобы сравнить его с образцом, или переключитесь в режим «Различия», чтобы рассмотреть несовпадения.

  1. Claude Opus 5.578.5/100Скульптура Claude Opus 5.5
  2. GPT-6.1 Sol74.7/100Скульптура GPT-6.1 Sol
  3. Claude Fable74.6/100Скульптура Claude Fable
  4. GPT-6 Astra73.5/100Скульптура GPT-6 Astra
  5. Claude Sonnet 5.548.1/100Скульптура Claude Sonnet 5.5
  6. GPT-6 Luna30.9/100Скульптура GPT-6 Luna

Качество, токены и время

Каких затрат потребовал каждый результат?

Сравните оценку, указанное суммарное количество входных и выходных токенов и время выполнения для выбранного раунда. Токены рассуждений повторно не прибавляются. Отсутствующие измерения исключаются, а не учитываются как нулевые.

Посмотреть измерения количества токенов и времени выполнения

Результаты измерений

От раунда к раунду.

Исходный результат сохраняет первоначальные результаты первого раунда и даты измерений. Следующая точка соответствует новому раунду измерений, а не результату за другую неделю.

Посмотреть зафиксированные оценки
Оценка по 100-балльной шкале для каждого раунда
РаундClaude Opus 5 / Claude Opus 5.5Claude Sonnet 5 / Claude Sonnet 5.5Claude FableGPT-6.1 SolGPT-6 AstraGPT-6 Luna
2026-W4178.5 (Claude Opus 5.5)48.1 (Claude Sonnet 5.5)74.6 (Claude Fable)74.7 (GPT-6.1 Sol)73.5 (GPT-6 Astra)30.9 (GPT-6 Luna)
Исходный результат75.5 (Claude Opus 5)34.3 (Claude Sonnet 5)71.2 (Claude Fable)70.6 (GPT-6.1 Sol)77.5 (GPT-6 Astra)45.6 (GPT-6 Luna)

О бенчмарке

Дайте ИИ 150 блоков. Попросите построить это.

Круглая голова. Изогнутое кресло. Крошечная настольная лампа. Насколько точно языковая модель сможет воссоздать всё это, используя только прямоугольные блоки?

Образец: белый робот в зелёном кресле за круглым столом с монитором, лампой, кружкой и растением
Скульптура, которую нужно воссоздать. 56 фигур.
блоков максимум
150
модели
6
попытка за раунд
1

Как это работает.

Неизменное задание.

Каждая модель получает одно и то же письменное задание с размерами и цветами образца. Полный текст задания доступен всем.

Только JSON.

Ответ содержит только описание не более 150 блоков с их координатами, размерами и цветами.

Одна попытка.

Средний уровень рассуждений, без инструментов и повторных попыток. Количество токенов и время выполнения фиксируются.

Неизменный алгоритм оценки.

Оценка от 0 до 100 за совпадение объёмов с образцом с учётом точности цветов.

Формула

процент совпадения объёмов × доля кубов с правильным цветом

Измеряется в единицах объёма по 1 см³. Отпечаток задания 08fb5a5773fe89e7. В исходной базе для сравнения сохранены первоначальные результаты первого раунда.

Полная методика и вопросы

Как это работает

В задании перечислены все геометрические фигуры образца с точными числовыми параметрами. Каждая модель отвечает только в формате JSON: до 150 прямоугольных блоков, для каждого из которых заданы положение, размер и один из 11 цветов. Сама модель ничего не рисует. При оценке результата мы визуализируем её блоки и образец из одинаковых маленьких кубиков, при одинаковом освещении и положении камеры, а затем публикуем изображения.

Оценка рассчитывается как степень совпадения объёмов скульптуры и образца (отношение пересечения к объединению, измеренное кубиками размером 1 см), умноженная на долю совпавших кубиков с правильным цветом. Использование одного блока на фигуру даёт менее 40 баллов; разбиение каждой фигуры на равные слои даёт около 50. Наклонные ножки, тонкие кабели и круглые головы позволяют лучше проявить себя моделям, которые продумывают положение каждого блока, а режим «Различия» показывает каждый недостающий, лишний и неверно окрашенный кубик.

Честность и повторяемость

Исходный результат соответствует первоначальному первому раунду и сохраняет фактические даты его измерений. К запуску был запрошен второй раунд измерений. Показаны оба раунда: ни один не датирован задним числом и не выбран как лучший из двух. Последующие раунды проводятся по еженедельному расписанию.

  • Каждую неделю используются одинаковое задание, одинаковая программа оценки и одинаковые настройки. Контрольный отпечаток задания v3: 08fb5a5773fe89e7; любое изменение означает новую версию и новый график.
  • Каждая модель отвечает один раз со средним уровнем усилий на рассуждение через Claude Code или Codex с авторизацией по подписке, так же, как её запускает VibeiDE. Без инструментов, интернета, повторных попыток и выбора лучшего из N ответов.
  • Модели запускаются последовательно, никогда параллельно. Если ответ не получен за 40 минут, модель получает 0 баллов.
  • Оценку выставляет детерминированная программа. Ни одна модель не оценивает другую.

Прочитать полное задание (обычный текст, 7,691 символов). Названия моделей соответствуют псевдонимам, доступным в каждом CLI; на странице записан идентификатор модели, который сообщил CLI.

Вопросы

Становятся ли Claude или GPT слабее?

Эта страница не раскрывает внутреннюю работу провайдера, но показывает, меняется ли со временем оценка модели с одним и тем же названием на одной и той же неизменной задаче. Один запуск в неделю даёт лишь одно наблюдение, поэтому считайте изменение на несколько баллов шумом, а падение, которое сохраняется несколько недель, сигналом.

Почему ни одна модель не может набрать 100?

Образец состоит из сфер, эллипсоидов, цилиндров и наклонных капсул, а в ответе можно использовать только 150 прямоугольных блоков, выровненных по осям координат. Блоки не могут точно повторить изгибы, поэтому в каждом ответе часть объёма теряется. Более сильные модели размещают блоки там, где нужно передать изгибы, и их скульптуры больше похожи на образец.

Как запускаются модели?

Каждая модель получает задание один раз через свой официальный инструмент командной строки, Claude Code или Codex, с авторизацией по обычной подписке и средним уровнем усилий на рассуждение. Инструменты, субагенты, доступ к интернету и повторные попытки отключены; запуск с использованием инструмента получает 0 баллов. Ответ оценивает детерминированная программа, а не другая модель.

Почему тест перешёл на v3?

В первых двух версиях моделям предлагалось спроектировать офис. В первых раундах лучшие модели набрали 100 и 92 балла, а все правильно спроектированные офисы выглядели одинаково. Тест, в котором лучшие модели достигают максимума, не позволяет отслеживать прогресс, а одинаковые ответы не позволяют увидеть разницу в качестве. Поэтому в v3 моделям предлагается создать скульптуру, качество которой видно с первого взгляда.

Можно ли самому попробовать выполнить задание?

Да. Полное задание опубликовано в виде обычного текста. Вставьте его в любую модель и сравните её ответ с образцом.

Языки

Necessary cookies support sign-in, security, your language and this choice. Optional categories stay off until accepted.

First-party page views and acquisition measurement, plus Google Analytics 4 (Google Ireland, data may reach the US). Advertising personalization stays off.

With Analytics enabled, retain Google and Microsoft ad click identifiers and share download, signup, activation and purchase conversions with the relevant ad provider. No personalized advertising.

Remember referral credit for later. Links still work on the current page without this cookie.

Privacy · Cookie inventory