Ofis Kıyaslaması
Hangi yapay zekâ en iyi inşa ediyor?
Altı model. Tek görev tanımı. Her birine tek deneme hakkı. Tam olarak hedef alınan yapıya göre 0 ile 100 arasında puanlanır.
Sıralama.
Her modelin inşa ettiği yapı.
Her modelin döndürdüğü JSON'dan görselleştirilen ham çıktı. Tek deneme, yeniden deneme yok.
Her heykelde aynı ışık, kamera ve ölçek kullanılır. Hedefle karşılaştırmak için herhangi bir sonucu seçin veya uyuşmazlıkları incelemek için Fark görünümüne geçin.
Notlar
Kalite, token ve süre
Her sonuç için ne kadar kaynak harcandı?
Seçili tur için puanı, bildirilen girdi ve çıktı tokenlarının toplamını ve geçen çalışma süresini karşılaştırın. Akıl yürütme tokenları tekrar eklenmez. Eksik ölçümler sıfır olarak sayılmaz, karşılaştırmaya dahil edilmez.
Token ve çalışma süresi ölçümlerini görüntüleyin
Ölçülen sonuçlar
Turdan tura.
Başlangıç referansı, ilk turun özgün sonuçlarını ve ölçüm tarihlerini korur. Bir sonraki nokta, farklı bir haftaya ait bir sonuç değil, yeni ölçülen bir turdur.
Kaydedilen puanları görüntüleyin
| Tur | Claude Opus 5 / Claude Opus 5.5 | Claude Sonnet 5 / Claude Sonnet 5.5 | Claude Fable | GPT-6.1 Sol | GPT-6 Astra | GPT-6 Luna |
|---|---|---|---|---|---|---|
| 2026-W41 | 78.5 (Claude Opus 5.5) | 48.1 (Claude Sonnet 5.5) | 74.6 (Claude Fable) | 74.7 (GPT-6.1 Sol) | 73.5 (GPT-6 Astra) | 30.9 (GPT-6 Luna) |
| Başlangıç referansı | 75.5 (Claude Opus 5) | 34.3 (Claude Sonnet 5) | 71.2 (Claude Fable) | 70.6 (GPT-6.1 Sol) | 77.5 (GPT-6 Astra) | 45.6 (GPT-6 Luna) |
Kıyaslama hakkında
Bir yapay zekâya 150 kutu verin. Bunu yapmasını isteyin.
Yuvarlak bir baş. Kavisli bir sandalye. Minik bir masa lambası. Bir dil modeli yalnızca dikdörtgen bloklar kullanarak hedefe ne kadar yaklaşabilir?
- kutu üst sınırı
- 150
- model
- 6
- tur başına deneme
- 1
Nasıl çalışır.
Sabit bir görev tanımı.
Her modele hedef boyutları ve renkleri içeren aynı yazılı görev tanımı verilir. Görev tanımının tamamı herkese açıktır.
Yalnızca JSON.
Yanıtta başka hiçbir şey bulunmaz: konumları, boyutları ve renkleri belirtilmiş en fazla 150 kutu.
Tek deneme.
Orta düzey akıl yürütme çabası, araç kullanımı yok, yeniden deneme yok. Token sayısı ve çalışma süresi takip edilir.
Sabit bir puanlama sistemi.
Hedefle hacimsel örtüşme, renk doğruluğuyla ağırlıklandırılarak 0 ile 100 arasında puanlanır.
Formül
hacimsel örtüşme yüzdesi × doğru renkteki küplerin oranı1 cm³ birimlerle ölçülür. Görev tanımının parmak izi 08fb5a5773fe89e7. Başlangıç referansı, ilk turun özgün sonuçlarını korur.
Metodolojinin tamamı ve sorular
Nasıl çalışır?
Görev tanımı, referans modeldeki her şekli kesin sayısal değerlerle listeliyor. Her model yalnızca JSON ile yanıt veriyor: en fazla 150 kutu, her kutu için bir konum, boyut ve 11 renkten biri. Modelin kendisi hiçbir şey çizmiyor. Bir çalıştırma puanlanırken, modelin kutularını ve referans modeli aynı küçük küplerden, aynı ışık ve kamerayla görselleştiriyor ve görselleri yayımlıyoruz.
Puan, heykel ile hedef arasındaki hacim örtüşmesinin (1 cm'lik küplerle ölçülen kesişimin birleşime oranı), ortak küpler arasında doğru renkte olanların oranıyla çarpılmasıyla hesaplanıyor. Her şekil için tek kutu kullanmak 40'ın altında puan getiriyor; her şekli eşit kalınlıkta dilimlere ayırmak ise yaklaşık 50 puan getiriyor. Eğimli ayaklar, ince kablolar ve yuvarlak kafalar, her kutunun nereye yerleştirileceğini planlayan modellere daha yüksek puan kazandırıyor. Fark görünümü de eksik, fazla ve yanlış renkteki tüm küpleri gösteriyor.
Adil ve tekrarlanabilir
Başlangıç referansı, gerçek ölçüm tarihleriyle korunan özgün ilk turdur. Lansman için ölçüm yapılan ikinci bir tur talep edildi. Her ikisi de gösterilir; hiçbirine geriye dönük tarih verilmez ve ikisinden daha iyi olanı seçilip sunulmaz. Sonraki turlar haftalık takvime göre yapılır.
- Her hafta aynı görev tanımı, aynı puanlama programı ve aynı ayarlar kullanılıyor. Görev tanımı v3'ün parmak izi
08fb5a5773fe89e7; herhangi bir değişiklik yeni bir sürüm ve yeni bir grafik başlatıyor. - Her model, abonelikle oturum açılmış Claude Code veya Codex üzerinden, orta düzey akıl yürütme çabasıyla bir kez yanıt verir. VibeiDE de onları aynı şekilde çalıştırır. Araç, web erişimi, yeniden deneme veya N deneme arasından en iyisini seçme yoktur.
- Modeller sırayla çalıştırılır, hiçbir zaman paralel çalıştırılmaz. 40 dakika içinde gelmeyen bir yanıt 0 puan alır.
- Puanlama programı deterministiktir. Hiçbir model başka bir modeli puanlamaz.
Görev tanımının tamamını okuyun (düz metin, 7,691 karakter). Model adları, her CLI'ın sunduğu takma adlardır; sayfa, CLI'ın bildirdiği model tanımlayıcısını kaydeder.
Sorular
Claude veya GPT'nin performansı düşürülüyor mu?
Bu sayfa, sağlayıcının içinde neler olduğunu göremez. Ancak aynı model adının, zaman içinde aynı sabit görevde farklı puanlar alıp almadığını gösterir. Haftada bir çalıştırma, tek bir örnek demektir. Bu yüzden birkaç puanlık değişimi gürültü, birkaç hafta süren düşüşü ise bir sinyal olarak değerlendirin.
Neden hiçbir model 100 puana ulaşamıyor?
Hedef; küreler, elipsoitler, silindirler ve eğimli kapsüllerden oluşuyor, ancak yanıtta yalnızca eksenlere paralel 150 kutu kullanılabiliyor. Kutular eğrileri tam olarak izleyemediği için her yanıt hacmin bir kısmını kaybediyor. Daha iyi modeller kutularını eğrilerin bulunduğu yerlerde kullanıyor ve oluşturdukları heykeller hedefe daha çok benziyor.
Modeller nasıl çalıştırılıyor?
Her modele görev tanımı, normal bir abonelikle oturum açılmış resmî komut satırı aracı Claude Code veya Codex üzerinden, orta düzey akıl yürütme ayarıyla bir kez veriliyor. Araçlar, alt ajanlar, web erişimi ve yeniden denemeler kapalı; araç kullanan bir çalıştırma 0 puan alıyor. Yanıtı başka bir model değil, deterministik bir program puanlıyor.
Karşılaştırma testi neden v3'e geçti?
İlk iki sürümde modellerden bir ofis düzenlemeleri isteniyordu. İlk turlarında en iyi modeller 100 ve 92 puan aldı ve doğru oluşturulan tüm ofisler birbirine benziyordu. En iyi modellerin tam puana ulaştığı bir test gelişimi gösteremez; yanıtların birbirine benzediği bir test de kaliteyi gösteremez. Bu nedenle v3, kalitesi ilk bakışta görülebilen bir heykel oluşturulmasını istiyor.
Görevi kendim deneyebilir miyim?
Evet. Görev tanımının tamamı düz metin olarak herkese açık. İstediğiniz modele yapıştırıp yanıtını hedefle karşılaştırın.