Office-ի համեմատական փորձարկում
Ո՞ր AI-ն է լավագույնը կառուցում։
Վեց մոդել։ Մեկ առաջադրանք։ Յուրաքանչյուրին՝ մեկ փորձ։ Գնահատվում են 0-ից 100՝ ըստ ճշգրիտ թիրախին համապատասխանության։
Առաջատարների աղյուսակ։
Ինչ է կառուցել յուրաքանչյուր մոդելը։
Չմշակված արդյունքը՝ պատկերված յուրաքանչյուր մոդելի վերադարձրած JSON-ից։ Մեկ փորձ՝ առանց կրկնափորձերի։
Բոլոր քանդակների համար օգտագործվում են նույն լուսավորությունը, տեսախցիկը և մասշտաբը։ Ընտրեք ցանկացած արդյունք՝ այն նպատակային պատկերի հետ համեմատելու համար, կամ անցեք «Տարբերություն» ռեժիմին՝ անհամապատասխանությունները ուսումնասիրելու համար։
Նշումներ
Որակ, թոքեններ և ժամանակ
Ի՞նչ ռեսուրսներ պահանջվեցին յուրաքանչյուր արդյունքի համար։
Համեմատեք ընտրված փուլի միավորը, հաշվետվությունում նշված մուտքային և ելքային թոքենների ընդհանուր քանակն ու գործարկման տևողությունը։ Դատողության թոքենները կրկին չեն գումարվում։ Բացակայող չափումները չեն ներառվում և զրո չեն համարվում։
Դիտեք թոքենների քանակի և գործարկման տևողության չափումները
Չափված արդյունքներ
Փուլից փուլ։
Սկզբնական ելակետը պահպանում է առաջին փուլի բնօրինակ արդյունքներն ու չափումների ամսաթվերը։ Հաջորդ կետը նոր չափված փուլ է, այլ ոչ թե մեկ այլ շաբաթվա արդյունք։
Դիտեք գրանցված միավորները
| Փուլ | Claude Opus 5 / Claude Opus 5.5 | Claude Sonnet 5 / Claude Sonnet 5.5 | Claude Fable | GPT-6.1 Sol | GPT-6 Astra | GPT-6 Luna |
|---|---|---|---|---|---|---|
| 2026-W41 | 78.5 (Claude Opus 5.5) | 48.1 (Claude Sonnet 5.5) | 74.6 (Claude Fable) | 74.7 (GPT-6.1 Sol) | 73.5 (GPT-6 Astra) | 30.9 (GPT-6 Luna) |
| Սկզբնական ելակետ | 75.5 (Claude Opus 5) | 34.3 (Claude Sonnet 5) | 71.2 (Claude Fable) | 70.6 (GPT-6.1 Sol) | 77.5 (GPT-6 Astra) | 45.6 (GPT-6 Luna) |
Համեմատական փորձարկման մասին
AI-ին տվեք 150 ուղղանկյուն զուգահեռանիստ։ Խնդրեք կառուցել սա։
Կլոր գլուխ։ Կորագիծ աթոռ։ Փոքրիկ սեղանի լամպ։ Որքանո՞վ կարող է լեզվային մոդելը մոտենալ բնօրինակին՝ օգտագործելով միայն ուղղանկյուն բլոկներ։
- բլոկ՝ առավելագույնը
- 150
- մոդել
- 6
- փորձ յուրաքանչյուր փուլում
- 1
Ինչպես է աշխատում։
Անփոփոխ առաջադրանք։
Յուրաքանչյուր մոդել ստանում է նույն գրավոր առաջադրանքը՝ թիրախային չափերով և գույներով։ Առաջադրանքի ամբողջական տեքստը հրապարակված է։
Միայն JSON։
Պատասխանը ոչինչ այլ չի պարունակում՝ մինչև 150 ուղղանկյուն զուգահեռանիստ՝ դիրքերով, չափերով և գույներով։
Մեկ փորձ։
Միջին մակարդակի դատողություն՝ առանց գործիքների և կրկնափորձերի։ Հաշվառվում են թոքեններն ու կատարման ժամանակը։
Գնահատման անփոփոխ համակարգ։
Թիրախի հետ ծավալային համընկնումը՝ կշռված գույների ճշգրտությամբ, 0-ից 100 սանդղակով։
Բանաձևը
ծավալային համընկնման % × ճիշտ գունավորված խորանարդների բաժինՉափվում է 1 cm³ միավորներով։ Առաջադրանքի թվային մատնահետքը՝ 08fb5a5773fe89e7։ Մեկնարկային բազային ցուցանիշը պահպանում է առաջին փուլի սկզբնական արդյունքները։
Ամբողջական մեթոդաբանություն և հարցեր
Ինչպես է այն աշխատում
Առաջադրանքում թվարկված են նմուշի բոլոր ձևերը՝ ճշգրիտ թվային տվյալներով։ Յուրաքանչյուր մոդել պատասխանում է միայն JSON ձևաչափով՝ ներկայացնելով առավելագույնը 150 ուղղանկյուն բլոկ, որոնցից յուրաքանչյուրի համար նշվում են դիրքը, չափը և 11 գույներից մեկը։ Մոդելն ինքնուրույն ոչինչ չի նկարում։ Արդյունքը գնահատելիս մենք մոդելի բլոկներն ու նմուշը պատկերում ենք նույն փոքր խորանարդներով՝ նույն լուսավորությամբ և տեսախցիկով, և հրապարակում պատկերները։
Միավորը քանդակի և նմուշի ծավալային համընկնումն է՝ հատման և միավորման հարաբերությունը՝ չափված 1 սմ խորանարդիկներով, բազմապատկած ճիշտ գույն ունեցող ընդհանուր խորանարդիկների բաժնով։ Յուրաքանչյուր մարմնի համար մեկ բլոկ օգտագործելը տալիս է 40-ից ցածր միավոր, իսկ յուրաքանչյուր մարմինը հավասար շերտերի բաժանելը՝ մոտ 50։ Թեք ոտքերը, բարակ մալուխներն ու կլոր գլուխներն ավելի բարձր միավոր են բերում այն մոդելներին, որոնք նախապես ծրագրում են յուրաքանչյուր բլոկի տեղը, իսկ «Տարբերություն» տեսքը ցույց է տալիս յուրաքանչյուր բացակայող, ավելորդ և սխալ գույնով խորանարդիկը։
Արդար և կրկնելի
Սկզբնական ելակետը բնօրինակ առաջին փուլն է՝ պահպանված չափումների իրական ամսաթվերով։ Գործարկման համար պահանջվել էր երկրորդ չափված փուլ։ Երկուսն էլ ցուցադրված են. ոչ մեկին ավելի վաղ ամսաթիվ չի վերագրվել, և ոչ մեկը չի ընտրվել որպես երկուսից լավագույն արդյունք։ Հետագա փուլերն անցկացվում են շաբաթական ժամանակացույցով։
- Ամեն շաբաթ նույն առաջադրանքը, նույն գնահատող ծրագիրը և նույն կարգավորումները։ Առաջադրանքի v3 տարբերակի նույնականացնող դրոշմն է
08fb5a5773fe89e7. ցանկացած փոփոխություն սկսում է նոր տարբերակ և նոր գծապատկեր։ - Յուրաքանչյուր մոդել պատասխանում է մեկ անգամ՝ դատողության միջին մակարդակով, բաժանորդագրությամբ մուտք գործած Claude Code-ի կամ Codex-ի միջոցով, նույն կերպ, ինչպես դրանք գործարկում է VibeiDE-ը։ Առանց գործիքների, համացանցի, կրկնակի փորձերի կամ N փորձից լավագույնի ընտրության։
- Մոդելները գործարկվում են մեկը մյուսի հետևից, երբեք՝ զուգահեռ։ Եթե պատասխանը չի ստացվում 40 րոպեի ընթացքում, գնահատականը 0 է։
- Գնահատողը դետերմինիստական ծրագիր է։ Ոչ մի մոդել չի գնահատում մեկ այլ մոդելի։
Կարդացեք ամբողջ առաջադրանքը (պարզ տեքստ, 7,691 նիշ)։ Մոդելների անունները յուրաքանչյուր CLI-ի առաջարկած այլանուններն են. էջը գրանցում է CLI-ի հաղորդած մոդելի նույնացուցիչը։
Հարցեր
Արդյո՞ք Claude-ի կամ GPT-ի հնարավորությունները սահմանափակվում են։
Այս էջը չի կարող տեսնել մատակարարի ներքին գործընթացները, բայց ցույց է տալիս՝ արդյոք նույն անվամբ մոդելը ժամանակի ընթացքում տարբեր միավորներ է ստանում նույն անփոփոխ առաջադրանքի համար։ Շաբաթական մեկ գործարկումը միայն մեկ դիտարկում է, ուստի մի քանի միավորի փոփոխությունը համարեք պատահական տատանում, իսկ մի քանի շաբաթ շարունակվող անկումը՝ ազդակ։
Ինչո՞ւ ոչ մի մոդել չի կարող հասնել 100-ի։
Նմուշը կազմված է գնդերից, էլիպսոիդներից, գլաններից և թեք պատիճաձև մարմիններից, իսկ պատասխանում թույլատրվում է օգտագործել միայն 150 ուղղանկյուն բլոկ՝ կոորդինատային առանցքներին զուգահեռ կողերով։ Բլոկները չեն կարող ճշգրտորեն կրկնել կորերը, ուստի յուրաքանչյուր պատասխան ծավալի որոշ կորուստ ունի։ Ավելի լավ մոդելներն իրենց բլոկները հատկացնում են կոր հատվածներին, և նրանց քանդակներն ավելի են նմանվում նմուշին։
Ինչպե՞ս են գործարկվում մոդելները։
Յուրաքանչյուր մոդել առաջադրանքը ստանում է մեկ անգամ՝ իր պաշտոնական հրամանային տողի գործիքի՝ Claude Code-ի կամ Codex-ի միջոցով, սովորական բաժանորդագրությամբ մուտք գործած և դատողության միջին ինտենսիվությամբ։ Գործիքները, ենթագործակալները, համացանցի հասանելիությունը և կրկնափորձերն անջատված են. գործիք օգտագործած գործարկումը ստանում է 0 միավոր։ Պատասխանը գնահատում է դետերմինիստական ծրագիրը, այլ ոչ թե մեկ այլ մոդել։
Ինչո՞ւ համեմատական թեստն անցավ v3 տարբերակին։
Առաջին երկու տարբերակներում մոդելներին առաջարկվում էր նախագծել գրասենյակի դասավորությունը։ Դրանց առաջին փուլերում լավագույն մոդելները ստացան 100 և 92 միավոր, իսկ բոլոր ճիշտ գրասենյակները նույն տեսքն ունեին։ Համեմատական թեստը չի կարող ցույց տալ փոփոխությունները, երբ լավագույն մոդելները հասնում են առավելագույն միավորին, և չի կարող ցույց տալ որակը, երբ պատասխանները նման են իրար։ Ուստի v3-ում պահանջվում է քանդակ, որի որակը տեսանելի է առաջին հայացքից։
Կարո՞ղ եմ ինքս փորձել առաջադրանքը։
Այո։ Ամբողջ առաջադրանքը հրապարակված է որպես պարզ տեքստ։ Տեղադրեք այն ցանկացած մոդելի մեջ և համեմատեք պատասխանը նմուշի հետ։