Ofis Kıyaslaması

Hangi yapay zekâ en iyi inşa ediyor?

Altı model. Tek görev tanımı. Her birine tek deneme hakkı. Tam olarak hedef alınan yapıya göre 0 ile 100 arasında puanlanır.

Sıralama.

Her modelin inşa ettiği yapı.

Her modelin döndürdüğü JSON'dan görselleştirilen ham çıktı. Tek deneme, yeniden deneme yok.

2026-W41 haftası

Her heykelde aynı ışık, kamera ve ölçek kullanılır. Hedefle karşılaştırmak için herhangi bir sonucu seçin veya uyuşmazlıkları incelemek için Fark görünümüne geçin.

  1. Claude Opus 5.578.5/100Claude Opus 5.5 heykeli
  2. GPT-6.1 Sol74.7/100GPT-6.1 Sol heykeli
  3. Claude Fable74.6/100Claude Fable heykeli
  4. GPT-6 Astra73.5/100GPT-6 Astra heykeli
  5. Claude Sonnet 5.548.1/100Claude Sonnet 5.5 heykeli
  6. GPT-6 Luna30.9/100GPT-6 Luna heykeli

Kalite, token ve süre

Her sonuç için ne kadar kaynak harcandı?

Seçili tur için puanı, bildirilen girdi ve çıktı tokenlarının toplamını ve geçen çalışma süresini karşılaştırın. Akıl yürütme tokenları tekrar eklenmez. Eksik ölçümler sıfır olarak sayılmaz, karşılaştırmaya dahil edilmez.

Token ve çalışma süresi ölçümlerini görüntüleyin

Ölçülen sonuçlar

Turdan tura.

Başlangıç referansı, ilk turun özgün sonuçlarını ve ölçüm tarihlerini korur. Bir sonraki nokta, farklı bir haftaya ait bir sonuç değil, yeni ölçülen bir turdur.

Kaydedilen puanları görüntüleyin
Turlara göre 100 üzerinden puan
TurClaude Opus 5 / Claude Opus 5.5Claude Sonnet 5 / Claude Sonnet 5.5Claude FableGPT-6.1 SolGPT-6 AstraGPT-6 Luna
2026-W4178.5 (Claude Opus 5.5)48.1 (Claude Sonnet 5.5)74.6 (Claude Fable)74.7 (GPT-6.1 Sol)73.5 (GPT-6 Astra)30.9 (GPT-6 Luna)
Başlangıç referansı75.5 (Claude Opus 5)34.3 (Claude Sonnet 5)71.2 (Claude Fable)70.6 (GPT-6.1 Sol)77.5 (GPT-6 Astra)45.6 (GPT-6 Luna)

Kıyaslama hakkında

Bir yapay zekâya 150 kutu verin. Bunu yapmasını isteyin.

Yuvarlak bir baş. Kavisli bir sandalye. Minik bir masa lambası. Bir dil modeli yalnızca dikdörtgen bloklar kullanarak hedefe ne kadar yaklaşabilir?

Hedef: Üzerinde monitör, lamba, kupa ve bitki bulunan yuvarlak bir masanın başında, yeşil bir sandalyede oturan beyaz bir robot
Yeniden oluşturulacak heykel. 56 şekil.
kutu üst sınırı
150
model
6
tur başına deneme
1

Nasıl çalışır.

Sabit bir görev tanımı.

Her modele hedef boyutları ve renkleri içeren aynı yazılı görev tanımı verilir. Görev tanımının tamamı herkese açıktır.

Yalnızca JSON.

Yanıtta başka hiçbir şey bulunmaz: konumları, boyutları ve renkleri belirtilmiş en fazla 150 kutu.

Tek deneme.

Orta düzey akıl yürütme çabası, araç kullanımı yok, yeniden deneme yok. Token sayısı ve çalışma süresi takip edilir.

Sabit bir puanlama sistemi.

Hedefle hacimsel örtüşme, renk doğruluğuyla ağırlıklandırılarak 0 ile 100 arasında puanlanır.

Formül

hacimsel örtüşme yüzdesi × doğru renkteki küplerin oranı

1 cm³ birimlerle ölçülür. Görev tanımının parmak izi 08fb5a5773fe89e7. Başlangıç referansı, ilk turun özgün sonuçlarını korur.

Metodolojinin tamamı ve sorular

Nasıl çalışır?

Görev tanımı, referans modeldeki her şekli kesin sayısal değerlerle listeliyor. Her model yalnızca JSON ile yanıt veriyor: en fazla 150 kutu, her kutu için bir konum, boyut ve 11 renkten biri. Modelin kendisi hiçbir şey çizmiyor. Bir çalıştırma puanlanırken, modelin kutularını ve referans modeli aynı küçük küplerden, aynı ışık ve kamerayla görselleştiriyor ve görselleri yayımlıyoruz.

Puan, heykel ile hedef arasındaki hacim örtüşmesinin (1 cm'lik küplerle ölçülen kesişimin birleşime oranı), ortak küpler arasında doğru renkte olanların oranıyla çarpılmasıyla hesaplanıyor. Her şekil için tek kutu kullanmak 40'ın altında puan getiriyor; her şekli eşit kalınlıkta dilimlere ayırmak ise yaklaşık 50 puan getiriyor. Eğimli ayaklar, ince kablolar ve yuvarlak kafalar, her kutunun nereye yerleştirileceğini planlayan modellere daha yüksek puan kazandırıyor. Fark görünümü de eksik, fazla ve yanlış renkteki tüm küpleri gösteriyor.

Adil ve tekrarlanabilir

Başlangıç referansı, gerçek ölçüm tarihleriyle korunan özgün ilk turdur. Lansman için ölçüm yapılan ikinci bir tur talep edildi. Her ikisi de gösterilir; hiçbirine geriye dönük tarih verilmez ve ikisinden daha iyi olanı seçilip sunulmaz. Sonraki turlar haftalık takvime göre yapılır.

  • Her hafta aynı görev tanımı, aynı puanlama programı ve aynı ayarlar kullanılıyor. Görev tanımı v3'ün parmak izi 08fb5a5773fe89e7; herhangi bir değişiklik yeni bir sürüm ve yeni bir grafik başlatıyor.
  • Her model, abonelikle oturum açılmış Claude Code veya Codex üzerinden, orta düzey akıl yürütme çabasıyla bir kez yanıt verir. VibeiDE de onları aynı şekilde çalıştırır. Araç, web erişimi, yeniden deneme veya N deneme arasından en iyisini seçme yoktur.
  • Modeller sırayla çalıştırılır, hiçbir zaman paralel çalıştırılmaz. 40 dakika içinde gelmeyen bir yanıt 0 puan alır.
  • Puanlama programı deterministiktir. Hiçbir model başka bir modeli puanlamaz.

Görev tanımının tamamını okuyun (düz metin, 7,691 karakter). Model adları, her CLI'ın sunduğu takma adlardır; sayfa, CLI'ın bildirdiği model tanımlayıcısını kaydeder.

Sorular

Claude veya GPT'nin performansı düşürülüyor mu?

Bu sayfa, sağlayıcının içinde neler olduğunu göremez. Ancak aynı model adının, zaman içinde aynı sabit görevde farklı puanlar alıp almadığını gösterir. Haftada bir çalıştırma, tek bir örnek demektir. Bu yüzden birkaç puanlık değişimi gürültü, birkaç hafta süren düşüşü ise bir sinyal olarak değerlendirin.

Neden hiçbir model 100 puana ulaşamıyor?

Hedef; küreler, elipsoitler, silindirler ve eğimli kapsüllerden oluşuyor, ancak yanıtta yalnızca eksenlere paralel 150 kutu kullanılabiliyor. Kutular eğrileri tam olarak izleyemediği için her yanıt hacmin bir kısmını kaybediyor. Daha iyi modeller kutularını eğrilerin bulunduğu yerlerde kullanıyor ve oluşturdukları heykeller hedefe daha çok benziyor.

Modeller nasıl çalıştırılıyor?

Her modele görev tanımı, normal bir abonelikle oturum açılmış resmî komut satırı aracı Claude Code veya Codex üzerinden, orta düzey akıl yürütme ayarıyla bir kez veriliyor. Araçlar, alt ajanlar, web erişimi ve yeniden denemeler kapalı; araç kullanan bir çalıştırma 0 puan alıyor. Yanıtı başka bir model değil, deterministik bir program puanlıyor.

Karşılaştırma testi neden v3'e geçti?

İlk iki sürümde modellerden bir ofis düzenlemeleri isteniyordu. İlk turlarında en iyi modeller 100 ve 92 puan aldı ve doğru oluşturulan tüm ofisler birbirine benziyordu. En iyi modellerin tam puana ulaştığı bir test gelişimi gösteremez; yanıtların birbirine benzediği bir test de kaliteyi gösteremez. Bu nedenle v3, kalitesi ilk bakışta görülebilen bir heykel oluşturulmasını istiyor.

Görevi kendim deneyebilir miyim?

Evet. Görev tanımının tamamı düz metin olarak herkese açık. İstediğiniz modele yapıştırıp yanıtını hedefle karşılaştırın.

Diller

Necessary cookies support sign-in, security, your language and this choice. Optional categories stay off until accepted.

First-party page views and acquisition measurement, plus Google Analytics 4 (Google Ireland, data may reach the US). Advertising personalization stays off.

With Analytics enabled, retain Google and Microsoft ad click identifiers and share download, signup, activation and purchase conversions with the relevant ad provider. No personalized advertising.

Remember referral credit for later. Links still work on the current page without this cookie.

Privacy · Cookie inventory