Офісний бенчмарк
Який ШІ будує найкраще?
Шість моделей. Одне технічне завдання. По одній спробі. Оцінка від 0 до 100 за точністю відтворення заданого зразка.
Таблиця лідерів.
Що побудувала кожна модель.
Необроблені результати, візуалізовані з JSON, який повернула кожна модель. Одна спроба, без повторів.
Для всіх скульптур використано однакове освітлення, камеру та масштаб. Виберіть будь-який результат, щоб порівняти його зі зразком, або перейдіть у режим «Різниця», щоб розглянути невідповідності.
Примітки
Якість, токени та час
Яких витрат потребував кожен результат?
Порівняйте оцінку, зафіксовану сумарну кількість вхідних і вихідних токенів та тривалість виконання для вибраного раунду. Токени міркування повторно не додаються. Відсутні вимірювання не враховуються, а не прирівнюються до нуля.
Переглянути вимірювання кількості токенів і тривалості виконання
Результати вимірювань
Від раунду до раунду.
Початкові базові результати зберігають оригінальні результати першого раунду та дати вимірювань. Наступна точка показує новий раунд вимірювань, а не результат з іншого тижня.
Переглянути зафіксовані оцінки
| Раунд | Claude Opus 5 / Claude Opus 5.5 | Claude Sonnet 5 / Claude Sonnet 5.5 | Claude Fable | GPT-6.1 Sol | GPT-6 Astra | GPT-6 Luna |
|---|---|---|---|---|---|---|
| 2026-W41 | 78.5 (Claude Opus 5.5) | 48.1 (Claude Sonnet 5.5) | 74.6 (Claude Fable) | 74.7 (GPT-6.1 Sol) | 73.5 (GPT-6 Astra) | 30.9 (GPT-6 Luna) |
| Початкові базові результати | 75.5 (Claude Opus 5) | 34.3 (Claude Sonnet 5) | 71.2 (Claude Fable) | 70.6 (GPT-6.1 Sol) | 77.5 (GPT-6 Astra) | 45.6 (GPT-6 Luna) |
Про бенчмарк
Дайте ШІ 150 блоків. Попросіть відтворити це.
Кругла голова. Вигнутий стілець. Крихітна настільна лампа. Наскільки точно мовна модель зможе відтворити все це лише прямокутними блоками?
- блоків щонайбільше
- 150
- моделі
- 6
- спроба за раунд
- 1
Як це працює.
Зафіксоване технічне завдання.
Кожна модель отримує те саме письмове технічне завдання із заданими розмірами та кольорами. Повний текст завдання доступний усім.
Лише JSON.
Відповідь не містить нічого іншого: до 150 блоків із координатами, розмірами та кольорами.
Одна спроба.
Середній рівень зусиль на міркування, без інструментів і повторних спроб. Кількість токенів і час виконання відстежуються.
Зафіксований алгоритм оцінювання.
Перекриття об’єму зі зразком, зважене за точністю кольорів, від 0 до 100.
Формула
перекриття об’єму у % × частка кубів із правильним кольоромВимірюється в одиницях по 1 см³. Відбиток технічного завдання 08fb5a5773fe89e7. Початковий базовий рівень зберігає оригінальні результати першого раунду.
Повна методологія та запитання
Як це працює
У завданні перелічено всі фігури зразка з точними числовими параметрами. Кожна модель відповідає лише у форматі JSON: до 150 прямокутних блоків, для кожного з яких задано положення, розмір і один з 11 кольорів. Сама модель нічого не малює. Під час оцінювання результату ми візуалізуємо її блоки та зразок з однакових маленьких кубиків, з однаковим освітленням і положенням камери, та публікуємо зображення.
Оцінка дорівнює коефіцієнту перекриття об’ємів скульптури та зразка (відношенню перетину до об’єднання, виміряному в кубиках розміром 1 см), помноженому на частку спільних кубиків із правильним кольором. Один блок на кожну фігуру дає менш ніж 40 балів; поділ кожної фігури на однакові шари дає близько 50. Похилі ніжки, тонкі кабелі та круглі голови дають перевагу моделям, які планують розташування кожного блока, а подання «Відмінності» показує кожен відсутній, зайвий і неправильно забарвлений кубик.
Справедливо й відтворювано
Початкові базові результати взято з оригінального першого раунду та збережено разом із фактичними датами вимірювань. До запуску було запитано другий раунд вимірювань. Показано обидва раунди; жодному не присвоєно дату заднім числом і жоден не вибрано як кращий із двох. Подальші раунди проводяться за щотижневим графіком.
- Щотижня використовуються те саме завдання, та сама програма оцінювання й ті самі налаштування. Завдання v3 має цифровий відбиток
08fb5a5773fe89e7; будь-яка зміна започатковує нову версію та новий графік. - Кожна модель відповідає один раз із середнім рівнем зусиль на міркування через Claude Code або Codex із входом через підписку, так само, як їх запускає VibeiDE. Без інструментів, доступу до інтернету, повторних спроб і вибору найкращої з N відповідей.
- Моделі запускаються одна за одною, ніколи не паралельно. Якщо відповідь не надходить протягом 40 хвилин, модель отримує 0 балів.
- Оцінювання виконує детермінована програма. Жодна модель не оцінює іншу модель.
Прочитати повний текст завдання (звичайний текст, 7,691 символів). Назви моделей відповідають псевдонімам, які пропонує кожен CLI; на сторінці зафіксовано ідентифікатор моделі, який повідомив CLI.
Запитання
Чи погіршують можливості Claude або GPT?
Ця сторінка не дає змоги зазирнути всередину провайдера, але показує, чи змінюються з часом оцінки моделі з тією самою назвою на тому самому незмінному завданні. Один запуск на тиждень дає лише один результат, тож сприймайте зміну на кілька балів як шум, а падіння, що триває кілька тижнів, як сигнал.
Чому жодна модель не може набрати 100?
Зразок складається зі сфер, еліпсоїдів, циліндрів і похилих капсул, а у відповіді можна використати лише 150 прямокутних блоків, вирівняних за осями координат. Блоки не можуть точно відтворити криві, тому кожна відповідь втрачає частину об’єму. Кращі моделі використовують більше блоків для криволінійних ділянок, і їхні скульптури більше схожі на зразок.
Як запускаються моделі?
Кожна модель отримує завдання один раз через свій офіційний інструмент командного рядка, Claude Code або Codex, з авторизацією за звичайною передплатою та середнім рівнем зусиль на міркування. Інструменти, субагенти, доступ до інтернету й повторні спроби вимкнено; запуск із використанням інструмента отримує 0 балів. Відповідь оцінює детермінована програма, а не інша модель.
Чому тест перейшов на v3?
У перших двох версіях моделі мали спланувати офіс. У перших раундах цих версій найкращі моделі набрали 100 і 92 бали, а всі правильно сплановані офіси виглядали однаково. Тест, у якому найкращі моделі досягають максимуму, не показує змін, а тест з однаковими на вигляд відповідями не показує якості. Тому у v3 потрібно створити скульптуру, якість якої видно з першого погляду.
Чи можу я спробувати виконати завдання самостійно?
Так. Повний текст завдання доступний усім у форматі звичайного тексту. Вставте його в будь-яку модель і порівняйте її відповідь зі зразком.