Офісны бенчмарк
Які ШІ будуе найлепш?
Шэсць мадэляў. Адно заданне. Па адной спробе. Ацэнка ад 0 да 100 паводле дакладнага супадзення з узорам.
Табліца лідараў.
Што пабудавала кожная мадэль.
Неапрацаваныя вынікі, візуалізаваныя з JSON, які вярнула кожная мадэль. Адна спроба, без паўтораў.
Для ўсіх скульптур выкарыстоўваюцца аднолькавыя асвятленне, камера і маштаб. Выберыце любы вынік, каб параўнаць яго з узорам, або пераключыцеся на «Адрозненні», каб разгледзець неадпаведнасці.
Заўвагі
Якасць, токены і час
Якіх рэсурсаў запатрабаваў кожны вынік?
Параўнайце ацэнку, заяўленую сумарную колькасць уваходных і выходных токенаў і працягласць выканання для выбранага раўнда. Токены разважанняў паўторна не дадаюцца. Адсутныя вымярэнні прапускаюцца, а не ўлічваюцца як нулявыя.
Праглядзець вымярэнні колькасці токенаў і часу выканання
Вымераныя вынікі
Раунд за раундам.
Пачатковыя вынікі захоўваюць зыходныя вынікі першага раўнда і даты вымярэнняў. Наступная кропка паказвае новы раўнд з вымярэннямі, а не вынік за іншы тыдзень.
Праглядзець зафіксаваныя ацэнкі
| Раунд | Claude Opus 5 / Claude Opus 5.5 | Claude Sonnet 5 / Claude Sonnet 5.5 | Claude Fable | GPT-6.1 Sol | GPT-6 Astra | GPT-6 Luna |
|---|---|---|---|---|---|---|
| 2026-W41 | 78.5 (Claude Opus 5.5) | 48.1 (Claude Sonnet 5.5) | 74.6 (Claude Fable) | 74.7 (GPT-6.1 Sol) | 73.5 (GPT-6 Astra) | 30.9 (GPT-6 Luna) |
| Пачатковыя вынікі | 75.5 (Claude Opus 5) | 34.3 (Claude Sonnet 5) | 71.2 (Claude Fable) | 70.6 (GPT-6.1 Sol) | 77.5 (GPT-6 Astra) | 45.6 (GPT-6 Luna) |
Пра бенчмарк
Дайце ШІ 150 паралелепіпедаў. Папрасіце стварыць гэта.
Круглая галава. Выгнутае крэсла. Маленькая настольная лямпа. Наколькі дакладна моўная мадэль можа ўзнавіць гэта, выкарыстоўваючы толькі прамавугольныя блокі?
- блокаў максімум
- 150
- мадэлі
- 6
- спроба за раўнд
- 1
Як гэта працуе.
Нязменнае заданне.
Кожная мадэль атрымлівае аднолькавае пісьмовае заданне з памерамі і колерамі ўзору. Поўны тэкст задання даступны публічна.
Толькі JSON.
Адказ не змяшчае нічога іншага: да 150 паралелепіпедаў з пазіцыямі, памерамі і колерамі.
Адна спроба.
Сярэдні ўзровень намаганняў на разважанне, без інструментаў і паўторных спроб. Улічваюцца токены і час выканання.
Нязменны алгарытм ацэнкі.
Перакрыцце аб’ёмаў з узорам, узважанае паводле дакладнасці колераў, ад 0 да 100.
Формула
перакрыцце аб’ёмаў у % × доля кубоў з правільным колерамВымяраецца ў адзінках па 1 cm³. Лічбавы адбітак задання 08fb5a5773fe89e7. Пачатковая база для параўнання захоўвае арыгінальныя вынікі першага раунда.
Поўная методыка і пытанні
Як гэта працуе
У заданні пералічаны ўсе фігуры ўзору з дакладнымі лікавымі параметрамі. Кожная мадэль адказвае толькі ў фармаце JSON: да 150 прамавугольных блокаў, для кожнага з якіх задаюцца пазіцыя, памер і адзін з 11 колераў. Сама мадэль нічога не малюе. Пры ацэнцы запуску мы візуалізуем яе блокі і ўзор з аднолькавых маленькіх кубікаў, з аднолькавым асвятленнем і ракурсам камеры, а затым публікуем выявы.
Ацэнка вылічаецца як адносіна аб’ёму перасячэння скульптуры і ўзору да аб’ёму іх аб’яднання, вымераных у кубіках памерам 1 см, памножаная на долю агульных кубікаў з правільным колерам. Адзін блок на кожную фігуру дае менш за 40 балаў; падзел кожнай фігуры на роўныя пласты дае каля 50. Нахіленыя ножкі, тонкія кабелі і круглыя галовы даюць перавагу мадэлям, якія плануюць размяшчэнне кожнага блока, а выгляд «Розніца» паказвае кожны адсутны, лішні і няправільна афарбаваны кубік.
Справядліва і ўзнаўляльна
Пачатковыя вынікі паходзяць з зыходнага першага раўнда і захаваны з фактычнымі датамі вымярэнняў. Для запуску быў запытаны другі раўнд з вымярэннямі. Паказаны абодва раўнды; ніводны не датаваны заднім чыслом і не выбраны як лепшы з двух. Наступныя раўнды праводзяцца паводле штотыднёвага раскладу.
- Кожны тыдзень выкарыстоўваюцца аднолькавае заданне, адна і тая ж праграма ацэнкі і аднолькавыя налады. Заданне v3 мае лічбавы адбітак
08fb5a5773fe89e7; любая змена пачынае новую версію і новы графік. - Кожная мадэль адказвае адзін раз з сярэднім узроўнем разважанняў праз Claude Code або Codex з уваходам праз падпіску, гэтак жа, як іх запускае VibeiDE. Без інструментаў, інтэрнэту, паўторных спроб і выбару найлепшага з N адказаў.
- Мадэлі запускаюцца адна за адной, ніколі не паралельна. Калі адказ не паступае за 40 хвілін, мадэль атрымлівае 0.
- Ацэньванне выконвае дэтэрмінаваная праграма. Ніводная мадэль не ацэньвае іншую мадэль.
Прачытайце поўнае заданне (звычайны тэкст, 7,691 сімвалаў). Назвы мадэляў адпавядаюць псеўданімам, якія прапануе кожны CLI; старонка захоўвае ідэнтыфікатар мадэлі, паведамлены CLI.
Пытанні
Ці пагаршаюць магчымасці Claude або GPT?
Гэтая старонка не дазваляе зазірнуць ва ўнутраныя працэсы пастаўшчыка, але паказвае, ці змяняецца з часам ацэнка мадэлі з той самай назвай на адным і тым жа нязменным заданні. Адзін запуск на тыдзень дае толькі адно назіранне, таму лічыце змену на некалькі балаў шумам, а падзенне, якое трымаецца некалькі тыдняў, сігналам.
Чаму ніводная мадэль не можа набраць 100 балаў?
Узор складаецца са сфер, эліпсоідаў, цыліндраў і нахіленых капсул, а ў адказе можна выкарыстоўваць толькі 150 прамавугольных блокаў, выраўнаваных па восях. Блокі не могуць дакладна паўтарыць крывыя, таму кожны адказ губляе частку аб’ёму. Лепшыя мадэлі размяркоўваюць блокі там, дзе ёсць крывыя, і іх скульптуры больш падобныя да ўзору.
Як запускаюцца мадэлі?
Кожная мадэль атрымлівае заданне адзін раз праз свой афіцыйны інструмент каманднага радка, Claude Code або Codex, з уваходам праз звычайную падпіску і сярэднім узроўнем намаганняў на разважанне. Інструменты, субагенты, доступ да інтэрнэту і паўторныя спробы адключаныя; запуск, у якім выкарыстоўваецца інструмент, атрымлівае 0 балаў. Адказ ацэньвае дэтэрмінаваная праграма, а не іншая мадэль.
Чаму тэст перайшоў на v3?
У першых дзвюх версіях мадэлі павінны былі спланаваць офіс. У першых раўндах лепшыя мадэлі набралі 100 і 92 балы, а ўсе правільна спланаваныя офісы выглядалі аднолькава. Тэст, у якім найлепшыя мадэлі дасягаюць максімуму, не можа паказаць змены, а тэст з падобнымі адказамі не можа паказаць якасць. Таму ў v3 трэба стварыць скульптуру, якасць якой відаць з першага погляду.
Ці магу я паспрабаваць заданне самастойна?
Так. Поўнае заданне апублікавана ў выглядзе звычайнага тэксту. Устаўце яго ў любую мадэль і параўнайце яе адказ з узорам.