Office-ի համեմատական փորձարկում

Ո՞ր AI-ն է լավագույնը կառուցում։

Վեց մոդել։ Մեկ առաջադրանք։ Յուրաքանչյուրին՝ մեկ փորձ։ Գնահատվում են 0-ից 100՝ ըստ ճշգրիտ թիրախին համապատասխանության։

Առաջատարների աղյուսակ։

Ինչ է կառուցել յուրաքանչյուր մոդելը։

Չմշակված արդյունքը՝ պատկերված յուրաքանչյուր մոդելի վերադարձրած JSON-ից։ Մեկ փորձ՝ առանց կրկնափորձերի։

Շաբաթ 2026-W41

Բոլոր քանդակների համար օգտագործվում են նույն լուսավորությունը, տեսախցիկը և մասշտաբը։ Ընտրեք ցանկացած արդյունք՝ այն նպատակային պատկերի հետ համեմատելու համար, կամ անցեք «Տարբերություն» ռեժիմին՝ անհամապատասխանությունները ուսումնասիրելու համար։

  1. Claude Opus 5.578.5/100Claude Opus 5.5-ի քանդակը
  2. GPT-6.1 Sol74.7/100GPT-6.1 Sol-ի քանդակը
  3. Claude Fable74.6/100Claude Fable-ի քանդակը
  4. GPT-6 Astra73.5/100GPT-6 Astra-ի քանդակը
  5. Claude Sonnet 5.548.1/100Claude Sonnet 5.5-ի քանդակը
  6. GPT-6 Luna30.9/100GPT-6 Luna-ի քանդակը

Որակ, թոքեններ և ժամանակ

Ի՞նչ ռեսուրսներ պահանջվեցին յուրաքանչյուր արդյունքի համար։

Համեմատեք ընտրված փուլի միավորը, հաշվետվությունում նշված մուտքային և ելքային թոքենների ընդհանուր քանակն ու գործարկման տևողությունը։ Դատողության թոքենները կրկին չեն գումարվում։ Բացակայող չափումները չեն ներառվում և զրո չեն համարվում։

Դիտեք թոքենների քանակի և գործարկման տևողության չափումները

Չափված արդյունքներ

Փուլից փուլ։

Սկզբնական ելակետը պահպանում է առաջին փուլի բնօրինակ արդյունքներն ու չափումների ամսաթվերը։ Հաջորդ կետը նոր չափված փուլ է, այլ ոչ թե մեկ այլ շաբաթվա արդյունք։

Դիտեք գրանցված միավորները
Միավորը՝ 100-ից, ըստ փուլերի
ՓուլClaude Opus 5 / Claude Opus 5.5Claude Sonnet 5 / Claude Sonnet 5.5Claude FableGPT-6.1 SolGPT-6 AstraGPT-6 Luna
2026-W4178.5 (Claude Opus 5.5)48.1 (Claude Sonnet 5.5)74.6 (Claude Fable)74.7 (GPT-6.1 Sol)73.5 (GPT-6 Astra)30.9 (GPT-6 Luna)
Սկզբնական ելակետ75.5 (Claude Opus 5)34.3 (Claude Sonnet 5)71.2 (Claude Fable)70.6 (GPT-6.1 Sol)77.5 (GPT-6 Astra)45.6 (GPT-6 Luna)

Համեմատական փորձարկման մասին

AI-ին տվեք 150 ուղղանկյուն զուգահեռանիստ։ Խնդրեք կառուցել սա։

Կլոր գլուխ։ Կորագիծ աթոռ։ Փոքրիկ սեղանի լամպ։ Որքանո՞վ կարող է լեզվային մոդելը մոտենալ բնօրինակին՝ օգտագործելով միայն ուղղանկյուն բլոկներ։

Նպատակային պատկերը՝ սպիտակ ռոբոտ՝ կանաչ աթոռին նստած, կլոր սեղանի մոտ, որի վրա կան մոնիտոր, լամպ, բաժակ և բույս
Վերաստեղծման ենթակա քանդակը։ 56 պատկեր։
բլոկ՝ առավելագույնը
150
մոդել
6
փորձ յուրաքանչյուր փուլում
1

Ինչպես է աշխատում։

Անփոփոխ առաջադրանք։

Յուրաքանչյուր մոդել ստանում է նույն գրավոր առաջադրանքը՝ թիրախային չափերով և գույներով։ Առաջադրանքի ամբողջական տեքստը հրապարակված է։

Միայն JSON։

Պատասխանը ոչինչ այլ չի պարունակում՝ մինչև 150 ուղղանկյուն զուգահեռանիստ՝ դիրքերով, չափերով և գույներով։

Մեկ փորձ։

Միջին մակարդակի դատողություն՝ առանց գործիքների և կրկնափորձերի։ Հաշվառվում են թոքեններն ու կատարման ժամանակը։

Գնահատման անփոփոխ համակարգ։

Թիրախի հետ ծավալային համընկնումը՝ կշռված գույների ճշգրտությամբ, 0-ից 100 սանդղակով։

Բանաձևը

ծավալային համընկնման % × ճիշտ գունավորված խորանարդների բաժին

Չափվում է 1 cm³ միավորներով։ Առաջադրանքի թվային մատնահետքը՝ 08fb5a5773fe89e7։ Մեկնարկային բազային ցուցանիշը պահպանում է առաջին փուլի սկզբնական արդյունքները։

Ամբողջական մեթոդաբանություն և հարցեր

Ինչպես է այն աշխատում

Առաջադրանքում թվարկված են նմուշի բոլոր ձևերը՝ ճշգրիտ թվային տվյալներով։ Յուրաքանչյուր մոդել պատասխանում է միայն JSON ձևաչափով՝ ներկայացնելով առավելագույնը 150 ուղղանկյուն բլոկ, որոնցից յուրաքանչյուրի համար նշվում են դիրքը, չափը և 11 գույներից մեկը։ Մոդելն ինքնուրույն ոչինչ չի նկարում։ Արդյունքը գնահատելիս մենք մոդելի բլոկներն ու նմուշը պատկերում ենք նույն փոքր խորանարդներով՝ նույն լուսավորությամբ և տեսախցիկով, և հրապարակում պատկերները։

Միավորը քանդակի և նմուշի ծավալային համընկնումն է՝ հատման և միավորման հարաբերությունը՝ չափված 1 սմ խորանարդիկներով, բազմապատկած ճիշտ գույն ունեցող ընդհանուր խորանարդիկների բաժնով։ Յուրաքանչյուր մարմնի համար մեկ բլոկ օգտագործելը տալիս է 40-ից ցածր միավոր, իսկ յուրաքանչյուր մարմինը հավասար շերտերի բաժանելը՝ մոտ 50։ Թեք ոտքերը, բարակ մալուխներն ու կլոր գլուխներն ավելի բարձր միավոր են բերում այն մոդելներին, որոնք նախապես ծրագրում են յուրաքանչյուր բլոկի տեղը, իսկ «Տարբերություն» տեսքը ցույց է տալիս յուրաքանչյուր բացակայող, ավելորդ և սխալ գույնով խորանարդիկը։

Արդար և կրկնելի

Սկզբնական ելակետը բնօրինակ առաջին փուլն է՝ պահպանված չափումների իրական ամսաթվերով։ Գործարկման համար պահանջվել էր երկրորդ չափված փուլ։ Երկուսն էլ ցուցադրված են. ոչ մեկին ավելի վաղ ամսաթիվ չի վերագրվել, և ոչ մեկը չի ընտրվել որպես երկուսից լավագույն արդյունք։ Հետագա փուլերն անցկացվում են շաբաթական ժամանակացույցով։

  • Ամեն շաբաթ նույն առաջադրանքը, նույն գնահատող ծրագիրը և նույն կարգավորումները։ Առաջադրանքի v3 տարբերակի նույնականացնող դրոշմն է 08fb5a5773fe89e7. ցանկացած փոփոխություն սկսում է նոր տարբերակ և նոր գծապատկեր։
  • Յուրաքանչյուր մոդել պատասխանում է մեկ անգամ՝ դատողության միջին մակարդակով, բաժանորդագրությամբ մուտք գործած Claude Code-ի կամ Codex-ի միջոցով, նույն կերպ, ինչպես դրանք գործարկում է VibeiDE-ը։ Առանց գործիքների, համացանցի, կրկնակի փորձերի կամ N փորձից լավագույնի ընտրության։
  • Մոդելները գործարկվում են մեկը մյուսի հետևից, երբեք՝ զուգահեռ։ Եթե պատասխանը չի ստացվում 40 րոպեի ընթացքում, գնահատականը 0 է։
  • Գնահատողը դետերմինիստական ծրագիր է։ Ոչ մի մոդել չի գնահատում մեկ այլ մոդելի։

Կարդացեք ամբողջ առաջադրանքը (պարզ տեքստ, 7,691 նիշ)։ Մոդելների անունները յուրաքանչյուր CLI-ի առաջարկած այլանուններն են. էջը գրանցում է CLI-ի հաղորդած մոդելի նույնացուցիչը։

Հարցեր

Արդյո՞ք Claude-ի կամ GPT-ի հնարավորությունները սահմանափակվում են։

Այս էջը չի կարող տեսնել մատակարարի ներքին գործընթացները, բայց ցույց է տալիս՝ արդյոք նույն անվամբ մոդելը ժամանակի ընթացքում տարբեր միավորներ է ստանում նույն անփոփոխ առաջադրանքի համար։ Շաբաթական մեկ գործարկումը միայն մեկ դիտարկում է, ուստի մի քանի միավորի փոփոխությունը համարեք պատահական տատանում, իսկ մի քանի շաբաթ շարունակվող անկումը՝ ազդակ։

Ինչո՞ւ ոչ մի մոդել չի կարող հասնել 100-ի։

Նմուշը կազմված է գնդերից, էլիպսոիդներից, գլաններից և թեք պատիճաձև մարմիններից, իսկ պատասխանում թույլատրվում է օգտագործել միայն 150 ուղղանկյուն բլոկ՝ կոորդինատային առանցքներին զուգահեռ կողերով։ Բլոկները չեն կարող ճշգրտորեն կրկնել կորերը, ուստի յուրաքանչյուր պատասխան ծավալի որոշ կորուստ ունի։ Ավելի լավ մոդելներն իրենց բլոկները հատկացնում են կոր հատվածներին, և նրանց քանդակներն ավելի են նմանվում նմուշին։

Ինչպե՞ս են գործարկվում մոդելները։

Յուրաքանչյուր մոդել առաջադրանքը ստանում է մեկ անգամ՝ իր պաշտոնական հրամանային տողի գործիքի՝ Claude Code-ի կամ Codex-ի միջոցով, սովորական բաժանորդագրությամբ մուտք գործած և դատողության միջին ինտենսիվությամբ։ Գործիքները, ենթագործակալները, համացանցի հասանելիությունը և կրկնափորձերն անջատված են. գործիք օգտագործած գործարկումը ստանում է 0 միավոր։ Պատասխանը գնահատում է դետերմինիստական ծրագիրը, այլ ոչ թե մեկ այլ մոդել։

Ինչո՞ւ համեմատական թեստն անցավ v3 տարբերակին։

Առաջին երկու տարբերակներում մոդելներին առաջարկվում էր նախագծել գրասենյակի դասավորությունը։ Դրանց առաջին փուլերում լավագույն մոդելները ստացան 100 և 92 միավոր, իսկ բոլոր ճիշտ գրասենյակները նույն տեսքն ունեին։ Համեմատական թեստը չի կարող ցույց տալ փոփոխությունները, երբ լավագույն մոդելները հասնում են առավելագույն միավորին, և չի կարող ցույց տալ որակը, երբ պատասխանները նման են իրար։ Ուստի v3-ում պահանջվում է քանդակ, որի որակը տեսանելի է առաջին հայացքից։

Կարո՞ղ եմ ինքս փորձել առաջադրանքը։

Այո։ Ամբողջ առաջադրանքը հրապարակված է որպես պարզ տեքստ։ Տեղադրեք այն ցանկացած մոդելի մեջ և համեմատեք պատասխանը նմուշի հետ։

Լեզուներ

Necessary cookies support sign-in, security, your language and this choice. Optional categories stay off until accepted.

First-party page views and acquisition measurement, plus Google Analytics 4 (Google Ireland, data may reach the US). Advertising personalization stays off.

With Analytics enabled, retain Google and Microsoft ad click identifiers and share download, signup, activation and purchase conversions with the relevant ad provider. No personalized advertising.

Remember referral credit for later. Links still work on the current page without this cookie.

Privacy · Cookie inventory