Канцелариски бенчмарк
Која ВИ гради најдобро?
Шест модели. Една задача. По еден обид. Оценети од 0 до 100 според совпаѓањето со точниот целен објект.
Ранг-листа.
Што изгради секој модел.
Необработениот резултат, визуелизиран од JSON што го врати секој модел. Еден обид, без повторување.
Секоја скулптура ги користи истите осветлување, камера и размер. Изберете кој било резултат за да го споредите со целта или префрлете се на „Разлика“ за да ги разгледате несовпаѓањата.
Белешки
Квалитет, токени и време
Што беше потребно за секој резултат?
Споредете ги оценката, пријавениот збир на влезни и излезни токени и времетраењето на извршувањето за избраниот круг. Токените за расудување не се додаваат повторно. Мерењата што недостасуваат се изоставуваат, а не се сметаат за нула.
Погледнете ги мерењата на токените и времетраењето на извршувањето
Измерени резултати
Од круг во круг.
Почетната референтна состојба ги зачувува првичните резултати од првиот круг и датумите на мерење. Следната точка претставува нов круг со свежи мерења, а не резултат од друга недела.
Погледнете ги забележаните оценки
| Круг | Claude Opus 5 / Claude Opus 5.5 | Claude Sonnet 5 / Claude Sonnet 5.5 | Claude Fable | GPT-6.1 Sol | GPT-6 Astra | GPT-6 Luna |
|---|---|---|---|---|---|---|
| 2026-W41 | 78.5 (Claude Opus 5.5) | 48.1 (Claude Sonnet 5.5) | 74.6 (Claude Fable) | 74.7 (GPT-6.1 Sol) | 73.5 (GPT-6 Astra) | 30.9 (GPT-6 Luna) |
| Почетна референтна состојба | 75.5 (Claude Opus 5) | 34.3 (Claude Sonnet 5) | 71.2 (Claude Fable) | 70.6 (GPT-6.1 Sol) | 77.5 (GPT-6 Astra) | 45.6 (GPT-6 Luna) |
За бенчмаркот
Дајте ѝ на ВИ 150 кутии. Побарајте го ова.
Тркалезна глава. Заоблен стол. Мала ламба за биро. Колку блиску може да стигне еден јазичен модел користејќи само правоаголни блокови?
- блокови најмногу
- 150
- модели
- 6
- обид по круг
- 1
Како функционира.
Фиксна задача.
Секој модел ја добива истата писмена задача со целните димензии и бои. Целиот текст на задачата е јавно достапен.
Само JSON.
Одговорот не содржи ништо друго: најмногу 150 кутии со позиции, димензии и бои.
Еден обид.
Средно ниво на напор за расудување, без алатки, без повторни обиди. Се следат токените и времето на извршување.
Фиксен систем за оценување.
Волуменско преклопување со целниот објект, пондерирано според точноста на боите, од 0 до 100.
Формулата
волуменско преклопување во % × удел на правилно обоени коцкиСе мери во единици од 1 cm³. Дигитален отпечаток на задачата 08fb5a5773fe89e7. Почетната референтна основа ги зачувува оригиналните резултати од првиот круг.
Целосна методологија и прашања
Како функционира
Во задачата е наведена секоја форма на зададениот модел со точни бројчени вредности. Секој модел одговара само со JSON: најмногу 150 квадарски блокови, секој со позиција, големина и една од 11 бои. Моделот самиот не црта ништо. При оценувањето на секое извршување, ги рендерираме неговите блокови и зададениот модел со исти мали коцки, исто осветлување и иста камера, а потоа ги објавуваме сликите.
Оценката е волуменското преклопување меѓу скулптурата и целниот модел (пресек поделен со унија, измерен во коцки од 1 cm), помножено со уделот на заедничките коцки со точна боја. Со една кутија по форма се добива оценка под 40; со делење на секоја форма на еднакви слоеви се добива околу 50. Накосените ногарки, тенките кабли и тркалезните глави им носат подобри оценки на моделите што планираат каде да ја постават секоја кутија, а приказот „Разлика“ ја покажува секоја коцка што недостасува, е вишок или има погрешна боја.
Праведно и повторливо
Почетната референтна состојба е првичниот прв круг, зачуван со вистинските датуми на мерење. За лансирањето беше побаран втор круг со мерења. Прикажани се двата круга; ниту еден не е датиран наназад, ниту е избран како најдобар резултат од двата. Подоцнежните кругови го следат неделниот распоред.
- Иста задача, иста програма за оценување и исти поставки секоја недела. Задачата v3 го има дигиталниот отпечаток
08fb5a5773fe89e7; секоја промена започнува нова верзија и нов графикон. - Секој модел одговара еднаш со средно ниво на напор за расудување, преку Claude Code или Codex со најавена сметка со претплата, на ист начин како што ги извршува VibeiDE. Без алатки, без веб, без повторни обиди и без избор на најдобриот од N одговори.
- Моделите се извршуваат еден по друг, никогаш паралелно. Одговор што нема да пристигне во рок од 40 минути добива оцена 0.
- Програмата за оценување е детерминистичка. Ниту еден модел не оценува друг модел.
Прочитајте го целосниот опис на задачата (обичен текст, 7,691 знаци). Имињата на моделите се алијасите што ги нуди секоја CLI алатка; страницата го бележи идентификаторот на моделот што го пријавила CLI алатката.
Прашања
Дали на Claude или GPT им се намалуваат способностите?
Оваа страница нема увид во внатрешното работење на давателот, но покажува дали модел со исто име со текот на времето добива различни оцени за истата фиксна задача. Едно извршување неделно е само еден примерок, па разлика од неколку поени сметајте ја за шум, а пад што трае неколку недели за сигнал.
Зошто ниту еден модел не може да достигне 100?
Целниот модел е составен од сфери, елипсоиди, цилиндри и накосени капсули, а одговорот смее да користи само 150 кутии порамнети со координатните оски. Кутиите не можат точно да ги следат кривините, па секој одговор губи дел од волуменот. Подобрите модели ги распределуваат кутиите таму каде што има кривини, а нивните скулптури повеќе наликуваат на целниот модел.
Како се извршуваат моделите?
Секој модел ја добива задачата еднаш преку својата официјална алатка за командната линија, Claude Code или Codex, со најава преку стандардна претплата и средно ниво на напор за расудување. Алатките, подагентите, веб-пристапот и повторните обиди се исклучени; извршување што користи алатка добива оценка 0. Одговорот го оценува детерминистичка програма, а не друг модел.
Зошто бенчмаркот премина на v3?
Во првите две верзии, моделите требаше да осмислат распоред на канцеларија. Во нивните први кругови, најдобрите модели добија оценки 100 и 92, а секоја правилно уредена канцеларија изгледаше исто. Бенчмарк на кој најдобрите модели ја достигнуваат максималната оценка не може да покаже промена, а бенчмарк со слични одговори не може да покаже квалитет. Затоа v3 бара скулптура чиј квалитет се гледа на прв поглед.
Можам ли сам да ја испробам задачата?
Да. Целосниот опис на задачата е јавно достапен како обичен текст. Залепете го во кој било модел и споредете го неговиот одговор со целниот модел.