Офісны бенчмарк

Які ШІ будуе найлепш?

Шэсць мадэляў. Адно заданне. Па адной спробе. Ацэнка ад 0 да 100 паводле дакладнага супадзення з узорам.

Табліца лідараў.

Што пабудавала кожная мадэль.

Неапрацаваныя вынікі, візуалізаваныя з JSON, які вярнула кожная мадэль. Адна спроба, без паўтораў.

Тыдзень 2026-W41

Для ўсіх скульптур выкарыстоўваюцца аднолькавыя асвятленне, камера і маштаб. Выберыце любы вынік, каб параўнаць яго з узорам, або пераключыцеся на «Адрозненні», каб разгледзець неадпаведнасці.

  1. Claude Opus 5.578.5/100Скульптура Claude Opus 5.5
  2. GPT-6.1 Sol74.7/100Скульптура GPT-6.1 Sol
  3. Claude Fable74.6/100Скульптура Claude Fable
  4. GPT-6 Astra73.5/100Скульптура GPT-6 Astra
  5. Claude Sonnet 5.548.1/100Скульптура Claude Sonnet 5.5
  6. GPT-6 Luna30.9/100Скульптура GPT-6 Luna

Якасць, токены і час

Якіх рэсурсаў запатрабаваў кожны вынік?

Параўнайце ацэнку, заяўленую сумарную колькасць уваходных і выходных токенаў і працягласць выканання для выбранага раўнда. Токены разважанняў паўторна не дадаюцца. Адсутныя вымярэнні прапускаюцца, а не ўлічваюцца як нулявыя.

Праглядзець вымярэнні колькасці токенаў і часу выканання

Вымераныя вынікі

Раунд за раундам.

Пачатковыя вынікі захоўваюць зыходныя вынікі першага раўнда і даты вымярэнняў. Наступная кропка паказвае новы раўнд з вымярэннямі, а не вынік за іншы тыдзень.

Праглядзець зафіксаваныя ацэнкі
Ацэнка са 100 балаў па раўндах
РаундClaude Opus 5 / Claude Opus 5.5Claude Sonnet 5 / Claude Sonnet 5.5Claude FableGPT-6.1 SolGPT-6 AstraGPT-6 Luna
2026-W4178.5 (Claude Opus 5.5)48.1 (Claude Sonnet 5.5)74.6 (Claude Fable)74.7 (GPT-6.1 Sol)73.5 (GPT-6 Astra)30.9 (GPT-6 Luna)
Пачатковыя вынікі75.5 (Claude Opus 5)34.3 (Claude Sonnet 5)71.2 (Claude Fable)70.6 (GPT-6.1 Sol)77.5 (GPT-6 Astra)45.6 (GPT-6 Luna)

Пра бенчмарк

Дайце ШІ 150 паралелепіпедаў. Папрасіце стварыць гэта.

Круглая галава. Выгнутае крэсла. Маленькая настольная лямпа. Наколькі дакладна моўная мадэль можа ўзнавіць гэта, выкарыстоўваючы толькі прамавугольныя блокі?

Узор: белы робат на зялёным крэсле за круглым сталом з маніторам, лямпай, кубкам і раслінай
Скульптура, якую трэба ўзнавіць. 56 фігур.
блокаў максімум
150
мадэлі
6
спроба за раўнд
1

Як гэта працуе.

Нязменнае заданне.

Кожная мадэль атрымлівае аднолькавае пісьмовае заданне з памерамі і колерамі ўзору. Поўны тэкст задання даступны публічна.

Толькі JSON.

Адказ не змяшчае нічога іншага: да 150 паралелепіпедаў з пазіцыямі, памерамі і колерамі.

Адна спроба.

Сярэдні ўзровень намаганняў на разважанне, без інструментаў і паўторных спроб. Улічваюцца токены і час выканання.

Нязменны алгарытм ацэнкі.

Перакрыцце аб’ёмаў з узорам, узважанае паводле дакладнасці колераў, ад 0 да 100.

Формула

перакрыцце аб’ёмаў у % × доля кубоў з правільным колерам

Вымяраецца ў адзінках па 1 cm³. Лічбавы адбітак задання 08fb5a5773fe89e7. Пачатковая база для параўнання захоўвае арыгінальныя вынікі першага раунда.

Поўная методыка і пытанні

Як гэта працуе

У заданні пералічаны ўсе фігуры ўзору з дакладнымі лікавымі параметрамі. Кожная мадэль адказвае толькі ў фармаце JSON: да 150 прамавугольных блокаў, для кожнага з якіх задаюцца пазіцыя, памер і адзін з 11 колераў. Сама мадэль нічога не малюе. Пры ацэнцы запуску мы візуалізуем яе блокі і ўзор з аднолькавых маленькіх кубікаў, з аднолькавым асвятленнем і ракурсам камеры, а затым публікуем выявы.

Ацэнка вылічаецца як адносіна аб’ёму перасячэння скульптуры і ўзору да аб’ёму іх аб’яднання, вымераных у кубіках памерам 1 см, памножаная на долю агульных кубікаў з правільным колерам. Адзін блок на кожную фігуру дае менш за 40 балаў; падзел кожнай фігуры на роўныя пласты дае каля 50. Нахіленыя ножкі, тонкія кабелі і круглыя галовы даюць перавагу мадэлям, якія плануюць размяшчэнне кожнага блока, а выгляд «Розніца» паказвае кожны адсутны, лішні і няправільна афарбаваны кубік.

Справядліва і ўзнаўляльна

Пачатковыя вынікі паходзяць з зыходнага першага раўнда і захаваны з фактычнымі датамі вымярэнняў. Для запуску быў запытаны другі раўнд з вымярэннямі. Паказаны абодва раўнды; ніводны не датаваны заднім чыслом і не выбраны як лепшы з двух. Наступныя раўнды праводзяцца паводле штотыднёвага раскладу.

  • Кожны тыдзень выкарыстоўваюцца аднолькавае заданне, адна і тая ж праграма ацэнкі і аднолькавыя налады. Заданне v3 мае лічбавы адбітак 08fb5a5773fe89e7; любая змена пачынае новую версію і новы графік.
  • Кожная мадэль адказвае адзін раз з сярэднім узроўнем разважанняў праз Claude Code або Codex з уваходам праз падпіску, гэтак жа, як іх запускае VibeiDE. Без інструментаў, інтэрнэту, паўторных спроб і выбару найлепшага з N адказаў.
  • Мадэлі запускаюцца адна за адной, ніколі не паралельна. Калі адказ не паступае за 40 хвілін, мадэль атрымлівае 0.
  • Ацэньванне выконвае дэтэрмінаваная праграма. Ніводная мадэль не ацэньвае іншую мадэль.

Прачытайце поўнае заданне (звычайны тэкст, 7,691 сімвалаў). Назвы мадэляў адпавядаюць псеўданімам, якія прапануе кожны CLI; старонка захоўвае ідэнтыфікатар мадэлі, паведамлены CLI.

Пытанні

Ці пагаршаюць магчымасці Claude або GPT?

Гэтая старонка не дазваляе зазірнуць ва ўнутраныя працэсы пастаўшчыка, але паказвае, ці змяняецца з часам ацэнка мадэлі з той самай назвай на адным і тым жа нязменным заданні. Адзін запуск на тыдзень дае толькі адно назіранне, таму лічыце змену на некалькі балаў шумам, а падзенне, якое трымаецца некалькі тыдняў, сігналам.

Чаму ніводная мадэль не можа набраць 100 балаў?

Узор складаецца са сфер, эліпсоідаў, цыліндраў і нахіленых капсул, а ў адказе можна выкарыстоўваць толькі 150 прамавугольных блокаў, выраўнаваных па восях. Блокі не могуць дакладна паўтарыць крывыя, таму кожны адказ губляе частку аб’ёму. Лепшыя мадэлі размяркоўваюць блокі там, дзе ёсць крывыя, і іх скульптуры больш падобныя да ўзору.

Як запускаюцца мадэлі?

Кожная мадэль атрымлівае заданне адзін раз праз свой афіцыйны інструмент каманднага радка, Claude Code або Codex, з уваходам праз звычайную падпіску і сярэднім узроўнем намаганняў на разважанне. Інструменты, субагенты, доступ да інтэрнэту і паўторныя спробы адключаныя; запуск, у якім выкарыстоўваецца інструмент, атрымлівае 0 балаў. Адказ ацэньвае дэтэрмінаваная праграма, а не іншая мадэль.

Чаму тэст перайшоў на v3?

У першых дзвюх версіях мадэлі павінны былі спланаваць офіс. У першых раўндах лепшыя мадэлі набралі 100 і 92 балы, а ўсе правільна спланаваныя офісы выглядалі аднолькава. Тэст, у якім найлепшыя мадэлі дасягаюць максімуму, не можа паказаць змены, а тэст з падобнымі адказамі не можа паказаць якасць. Таму ў v3 трэба стварыць скульптуру, якасць якой відаць з першага погляду.

Ці магу я паспрабаваць заданне самастойна?

Так. Поўнае заданне апублікавана ў выглядзе звычайнага тэксту. Устаўце яго ў любую мадэль і параўнайце яе адказ з узорам.

Мовы

Necessary cookies support sign-in, security, your language and this choice. Optional categories stay off until accepted.

First-party page views and acquisition measurement, plus Google Analytics 4 (Google Ireland, data may reach the US). Advertising personalization stays off.

With Analytics enabled, retain Google and Microsoft ad click identifiers and share download, signup, activation and purchase conversions with the relevant ad provider. No personalized advertising.

Remember referral credit for later. Links still work on the current page without this cookie.

Privacy · Cookie inventory