Ofis müqayisə sınağı

Hansı süni intellekt daha yaxşı qurur?

Altı model. Bir tapşırıq. Hərəsinə bir cəhd. Dəqiq hədəfə uyğunluğa görə 0-dan 100-ə qədər qiymətləndirilir.

Reytinq cədvəli.

Hər modelin qurduğu iş.

Hər modelin qaytardığı JSON əsasında vizuallaşdırılmış ilkin nəticə. Bir cəhd, təkrar yoxdur.

2026-W41 həftəsi

Bütün heykəllər üçün eyni işıqlandırma, kamera və miqyas istifadə olunur. Hədəflə müqayisə etmək üçün istənilən nəticəni seçin və ya uyğunsuzluqları nəzərdən keçirmək üçün Fərq görünüşünə keçin.

  1. Claude Opus 5.578.5/100Claude Opus 5.5 heykəli
  2. GPT-6.1 Sol74.7/100GPT-6.1 Sol heykəli
  3. Claude Fable74.6/100Claude Fable heykəli
  4. GPT-6 Astra73.5/100GPT-6 Astra heykəli
  5. Claude Sonnet 5.548.1/100Claude Sonnet 5.5 heykəli
  6. GPT-6 Luna30.9/100GPT-6 Luna heykəli

Keyfiyyət, tokenlər və vaxt

Hər nəticə üçün nə qədər resurs sərf olundu?

Seçilmiş mərhələ üzrə balı, bildirilmiş giriş və çıxış tokenlərinin cəmini və icraya sərf olunan vaxtı müqayisə edin. Mühakimə tokenləri yenidən əlavə edilmir. Çatışmayan ölçmələr sıfır sayılmır, hesablamaya daxil edilmir.

Token və icra müddəti ölçmələrinə baxın

Ölçülmüş nəticələr

Mərhələdən mərhələyə.

İlkin istinad nəticələri ilk mərhələnin orijinal nəticələrini və ölçmə tarixlərini qoruyur. Növbəti nöqtə başqa həftənin nəticəsini deyil, yeni ölçülmüş mərhələni göstərir.

Qeydə alınmış ballara baxın
Mərhələlər üzrə 100 üzərindən bal
MərhələClaude Opus 5 / Claude Opus 5.5Claude Sonnet 5 / Claude Sonnet 5.5Claude FableGPT-6.1 SolGPT-6 AstraGPT-6 Luna
2026-W4178.5 (Claude Opus 5.5)48.1 (Claude Sonnet 5.5)74.6 (Claude Fable)74.7 (GPT-6.1 Sol)73.5 (GPT-6 Astra)30.9 (GPT-6 Luna)
İlkin istinad nəticələri75.5 (Claude Opus 5)34.3 (Claude Sonnet 5)71.2 (Claude Fable)70.6 (GPT-6.1 Sol)77.5 (GPT-6 Astra)45.6 (GPT-6 Luna)

Müqayisə sınağı haqqında

Süni intellektə 150 qutu verin. Bunu qurmasını istəyin.

Yumru baş. Əyri xətli stul. Balaca masa lampası. Dil modeli yalnız düzbucaqlı bloklardan istifadə edərək nümunəyə nə qədər yaxınlaşa bilər?

Hədəf: üzərində monitor, lampa, fincan və bitki olan yumru masanın arxasında, yaşıl stulda oturan ağ robot
Yenidən qurulmalı heykəl. 56 fiqur.
maksimum qutu sayı
150
model
6
hər mərhələdə cəhd
1

Necə işləyir.

Dəyişməz tapşırıq.

Hər model hədəfin ölçüləri və rəngləri göstərilən eyni yazılı tapşırığı alır. Tapşırığın tam mətni hamı üçün açıqdır.

Yalnız JSON.

Cavabda yalnız mövqeləri, ölçüləri və rəngləri göstərilən ən çox 150 qutu olur.

Bir cəhd.

Orta səviyyəli düşünmə səyi, alətsiz və təkrar cəhdsiz. Token sayı və icra müddəti qeydə alınır.

Dəyişməz qiymətləndirmə mexanizmi.

Hədəflə həcm üzrə üst-üstə düşmə rəng dəqiqliyinə görə çəkiləndirilərək 0-dan 100-ə qədər qiymətləndirilir.

Düstur

həcm üzrə üst-üstə düşmə faizi × düzgün rənglənmiş kubların payı

1 cm³ vahidlərlə ölçülür. Tapşırığın rəqəmsal izi 08fb5a5773fe89e7. İlkin müqayisə bazası birinci mərhələnin orijinal nəticələrini saxlayır.

Tam metodologiya və suallar

Necə işləyir

Tapşırıqda nümunənin hər bir həndəsi forması dəqiq rəqəmlərlə təsvir olunur. Hər model yalnız JSON ilə cavab verir: ən çox 150 qutuşəkilli blok, hər biri üçün mövqe, ölçü və 11 rəngdən biri. Model özü heç nə çəkmir. Bir icranın nəticəsini qiymətləndirərkən onun bloklarını və nümunəni eyni kiçik kublardan istifadə edərək eyni işıqlandırma və kamera ilə vizuallaşdırır və şəkilləri dərc edirik.

Bal heykəllə hədəfin həcm uyğunluğunun (1 sm-lik kublarla ölçülən kəsişmənin birləşməyə nisbəti) ortaq kublar arasında düzgün rəngli kubların payına vurulması ilə hesablanır. Hər forma üçün bir qutudan istifadə 40-dan aşağı bal verir; hər formanı bərabər qalınlıqlı qatlara bölmək isə təxminən 50 bal verir. Maili ayaqlar, nazik kabellər və dairəvi başlar hər qutunun yerini planlaşdıran modellərə daha yüksək bal qazandırır. Fərq görünüşü isə çatışmayan, artıq və yanlış rəngli hər kubu göstərir.

Ədalətli və təkrarlana bilən

İlkin istinad nəticələri faktiki ölçmə tarixləri ilə birlikdə qorunan orijinal ilk mərhələyə aiddir. İstifadəyə verilmə üçün ikinci ölçülmüş mərhələ tələb olunub. Hər ikisi göstərilir; heç birinə geriyə tarix qoyulmayıb və heç biri iki nəticədən ən yaxşısı kimi seçilməyib. Sonrakı mərhələlər həftəlik cədvələ uyğun keçirilir.

  • Hər həftə eyni tapşırıq, eyni qiymətləndirmə proqramı və eyni parametrlər istifadə olunur. Tapşırığın v3 versiyasının rəqəmsal izi 08fb5a5773fe89e7 şəklindədir; hər hansı dəyişiklik yeni versiya və yeni qrafik yaradır.
  • Hər model abunəliklə hesaba daxil olunmuş Claude Code və ya Codex vasitəsilə orta səviyyəli mühakimə səyi ilə bir dəfə cavab verir. VibeiDE də onları bu şəkildə işə salır. Alətlər, vebə giriş, təkrar cəhdlər və N cavab arasından ən yaxşısının seçilməsi yoxdur.
  • Modellər bir-birinin ardınca işə salınır, heç vaxt paralel işləmir. 40 dəqiqə ərzində gəlməyən cavab 0 bal alır.
  • Qiymətləndirməni deterministik proqram aparır. Heç bir model başqa modeli qiymətləndirmir.

Tapşırığın tam mətnini oxuyun (sadə mətn, 7,691 simvol). Model adları hər CLI-nin təklif etdiyi alternativ adlardır; səhifədə CLI-nin bildirdiyi model identifikatoru qeyd olunur.

Suallar

Claude və ya GPT zəiflədilir?

Bu səhifə provayderin daxilində nə baş verdiyini görə bilmir, amma eyni model adının zaman keçdikcə eyni sabit tapşırıqda fərqli ballar alıb-almadığını göstərir. Həftədə bir icra yalnız bir nümunədir. Buna görə bir neçə ballıq dəyişməni təsadüfi dalğalanma, bir neçə həftə davam edən enişi isə siqnal kimi qəbul edin.

Niyə heç bir model 100 bal toplaya bilmir?

Hədəf kürələrdən, ellipsoidlərdən, silindrlərdən və maili kapsullardan ibarətdir, cavabda isə yalnız oxlara paralel 150 qutudan istifadə etmək olar. Qutular əyriləri dəqiq izləyə bilmədiyi üçün hər cavabda həcmin bir hissəsi itir. Daha yaxşı modellər qutularını əyri hissələrə sərf edir və onların heykəlləri hədəfə daha çox bənzəyir.

Modellər necə işə salınır?

Hər model tapşırığı adi abunəlik hesabına daxil olunmuş rəsmi əmr sətri aləti, Claude Code və ya Codex vasitəsilə bir dəfə, orta düşünmə səyi səviyyəsində alır. Alətlər, alt agentlər, vebə çıxış və təkrar cəhdlər deaktivdir; alətdən istifadə edilən icra 0 bal alır. Cavabı başqa model deyil, deterministik proqram qiymətləndirir.

Niyə müqayisə testi v3 versiyasına keçdi?

İlk iki versiyada modellərdən ofis tərtib etmək istənilirdi. Onların ilk turlarında ən yaxşı modellər 100 və 92 bal topladı və düzgün qurulmuş bütün ofislər eyni görünürdü. Ən yaxşı modellərin maksimum bal topladığı test dəyişiklikləri, cavabların bir-birinə bənzədiyi test isə keyfiyyəti göstərə bilmir. Buna görə v3 keyfiyyəti bir baxışda görünən heykəl qurmağı tələb edir.

Tapşırığı özüm sınaya bilərəm?

Bəli. Tapşırığın tam mətni sadə mətn formatında açıqdır. Onu istənilən modelə daxil edin və cavabını hədəflə müqayisə edin.

Dillər

Necessary cookies support sign-in, security, your language and this choice. Optional categories stay off until accepted.

First-party page views and acquisition measurement, plus Google Analytics 4 (Google Ireland, data may reach the US). Advertising personalization stays off.

With Analytics enabled, retain Google and Microsoft ad click identifiers and share download, signup, activation and purchase conversions with the relevant ad provider. No personalized advertising.

Remember referral credit for later. Links still work on the current page without this cookie.

Privacy · Cookie inventory