Канцелариски бенчмарк

Која ВИ гради најдобро?

Шест модели. Една задача. По еден обид. Оценети од 0 до 100 според совпаѓањето со точниот целен објект.

Ранг-листа.

Што изгради секој модел.

Необработениот резултат, визуелизиран од JSON што го врати секој модел. Еден обид, без повторување.

Недела 2026-W41

Секоја скулптура ги користи истите осветлување, камера и размер. Изберете кој било резултат за да го споредите со целта или префрлете се на „Разлика“ за да ги разгледате несовпаѓањата.

  1. Claude Opus 5.578.5/100Скулптура од Claude Opus 5.5
  2. GPT-6.1 Sol74.7/100Скулптура од GPT-6.1 Sol
  3. Claude Fable74.6/100Скулптура од Claude Fable
  4. GPT-6 Astra73.5/100Скулптура од GPT-6 Astra
  5. Claude Sonnet 5.548.1/100Скулптура од Claude Sonnet 5.5
  6. GPT-6 Luna30.9/100Скулптура од GPT-6 Luna

Квалитет, токени и време

Што беше потребно за секој резултат?

Споредете ги оценката, пријавениот збир на влезни и излезни токени и времетраењето на извршувањето за избраниот круг. Токените за расудување не се додаваат повторно. Мерењата што недостасуваат се изоставуваат, а не се сметаат за нула.

Погледнете ги мерењата на токените и времетраењето на извршувањето

Измерени резултати

Од круг во круг.

Почетната референтна состојба ги зачувува првичните резултати од првиот круг и датумите на мерење. Следната точка претставува нов круг со свежи мерења, а не резултат од друга недела.

Погледнете ги забележаните оценки
Оценка од 100 по круг
КругClaude Opus 5 / Claude Opus 5.5Claude Sonnet 5 / Claude Sonnet 5.5Claude FableGPT-6.1 SolGPT-6 AstraGPT-6 Luna
2026-W4178.5 (Claude Opus 5.5)48.1 (Claude Sonnet 5.5)74.6 (Claude Fable)74.7 (GPT-6.1 Sol)73.5 (GPT-6 Astra)30.9 (GPT-6 Luna)
Почетна референтна состојба75.5 (Claude Opus 5)34.3 (Claude Sonnet 5)71.2 (Claude Fable)70.6 (GPT-6.1 Sol)77.5 (GPT-6 Astra)45.6 (GPT-6 Luna)

За бенчмаркот

Дајте ѝ на ВИ 150 кутии. Побарајте го ова.

Тркалезна глава. Заоблен стол. Мала ламба за биро. Колку блиску може да стигне еден јазичен модел користејќи само правоаголни блокови?

Целта: бел робот на зелен стол покрај тркалезно биро со монитор, ламба, шолја и растение
Скулптурата што треба да се пресоздаде. 56 форми.
блокови најмногу
150
модели
6
обид по круг
1

Како функционира.

Фиксна задача.

Секој модел ја добива истата писмена задача со целните димензии и бои. Целиот текст на задачата е јавно достапен.

Само JSON.

Одговорот не содржи ништо друго: најмногу 150 кутии со позиции, димензии и бои.

Еден обид.

Средно ниво на напор за расудување, без алатки, без повторни обиди. Се следат токените и времето на извршување.

Фиксен систем за оценување.

Волуменско преклопување со целниот објект, пондерирано според точноста на боите, од 0 до 100.

Формулата

волуменско преклопување во % × удел на правилно обоени коцки

Се мери во единици од 1 cm³. Дигитален отпечаток на задачата 08fb5a5773fe89e7. Почетната референтна основа ги зачувува оригиналните резултати од првиот круг.

Целосна методологија и прашања

Како функционира

Во задачата е наведена секоја форма на зададениот модел со точни бројчени вредности. Секој модел одговара само со JSON: најмногу 150 квадарски блокови, секој со позиција, големина и една од 11 бои. Моделот самиот не црта ништо. При оценувањето на секое извршување, ги рендерираме неговите блокови и зададениот модел со исти мали коцки, исто осветлување и иста камера, а потоа ги објавуваме сликите.

Оценката е волуменското преклопување меѓу скулптурата и целниот модел (пресек поделен со унија, измерен во коцки од 1 cm), помножено со уделот на заедничките коцки со точна боја. Со една кутија по форма се добива оценка под 40; со делење на секоја форма на еднакви слоеви се добива околу 50. Накосените ногарки, тенките кабли и тркалезните глави им носат подобри оценки на моделите што планираат каде да ја постават секоја кутија, а приказот „Разлика“ ја покажува секоја коцка што недостасува, е вишок или има погрешна боја.

Праведно и повторливо

Почетната референтна состојба е првичниот прв круг, зачуван со вистинските датуми на мерење. За лансирањето беше побаран втор круг со мерења. Прикажани се двата круга; ниту еден не е датиран наназад, ниту е избран како најдобар резултат од двата. Подоцнежните кругови го следат неделниот распоред.

  • Иста задача, иста програма за оценување и исти поставки секоја недела. Задачата v3 го има дигиталниот отпечаток 08fb5a5773fe89e7; секоја промена започнува нова верзија и нов графикон.
  • Секој модел одговара еднаш со средно ниво на напор за расудување, преку Claude Code или Codex со најавена сметка со претплата, на ист начин како што ги извршува VibeiDE. Без алатки, без веб, без повторни обиди и без избор на најдобриот од N одговори.
  • Моделите се извршуваат еден по друг, никогаш паралелно. Одговор што нема да пристигне во рок од 40 минути добива оцена 0.
  • Програмата за оценување е детерминистичка. Ниту еден модел не оценува друг модел.

Прочитајте го целосниот опис на задачата (обичен текст, 7,691 знаци). Имињата на моделите се алијасите што ги нуди секоја CLI алатка; страницата го бележи идентификаторот на моделот што го пријавила CLI алатката.

Прашања

Дали на Claude или GPT им се намалуваат способностите?

Оваа страница нема увид во внатрешното работење на давателот, но покажува дали модел со исто име со текот на времето добива различни оцени за истата фиксна задача. Едно извршување неделно е само еден примерок, па разлика од неколку поени сметајте ја за шум, а пад што трае неколку недели за сигнал.

Зошто ниту еден модел не може да достигне 100?

Целниот модел е составен од сфери, елипсоиди, цилиндри и накосени капсули, а одговорот смее да користи само 150 кутии порамнети со координатните оски. Кутиите не можат точно да ги следат кривините, па секој одговор губи дел од волуменот. Подобрите модели ги распределуваат кутиите таму каде што има кривини, а нивните скулптури повеќе наликуваат на целниот модел.

Како се извршуваат моделите?

Секој модел ја добива задачата еднаш преку својата официјална алатка за командната линија, Claude Code или Codex, со најава преку стандардна претплата и средно ниво на напор за расудување. Алатките, подагентите, веб-пристапот и повторните обиди се исклучени; извршување што користи алатка добива оценка 0. Одговорот го оценува детерминистичка програма, а не друг модел.

Зошто бенчмаркот премина на v3?

Во првите две верзии, моделите требаше да осмислат распоред на канцеларија. Во нивните први кругови, најдобрите модели добија оценки 100 и 92, а секоја правилно уредена канцеларија изгледаше исто. Бенчмарк на кој најдобрите модели ја достигнуваат максималната оценка не може да покаже промена, а бенчмарк со слични одговори не може да покаже квалитет. Затоа v3 бара скулптура чиј квалитет се гледа на прв поглед.

Можам ли сам да ја испробам задачата?

Да. Целосниот опис на задачата е јавно достапен како обичен текст. Залепете го во кој било модел и споредете го неговиот одговор со целниот модел.

Јазици

Necessary cookies support sign-in, security, your language and this choice. Optional categories stay off until accepted.

First-party page views and acquisition measurement, plus Google Analytics 4 (Google Ireland, data may reach the US). Advertising personalization stays off.

With Analytics enabled, retain Google and Microsoft ad click identifiers and share download, signup, activation and purchase conversions with the relevant ad provider. No personalized advertising.

Remember referral credit for later. Links still work on the current page without this cookie.

Privacy · Cookie inventory