Irodai benchmark
Melyik AI épít a legjobban?
Hat modell. Egy feladatleírás. Mindegyiknek egy próbálkozás. Pontozás 0-tól 100-ig, a pontos célalakzathoz viszonyítva.
Ranglista.
Mit építettek az egyes modellek.
Nyers kimenet, az egyes modellek által visszaadott JSON alapján megjelenítve. Egy próbálkozás, újrapróbálkozás nélkül.
Minden szobornál azonos a megvilágítás, a kamera és a méretarány. Válassz ki egy eredményt, hogy összehasonlíthasd a mintával, vagy válts a Különbség nézetre az eltérések megvizsgálásához.
Megjegyzések
Minőség, tokenek és idő
Mennyi erőforrást igényelt egy-egy eredmény?
Hasonlítsd össze a kiválasztott kör pontszámát, a jelentett bemeneti és kimeneti tokenek összegét, valamint a futásidőt. A gondolkodási tokeneket nem adjuk hozzá még egyszer. A hiányzó méréseket kihagyjuk, nem számítjuk nullának.
Nézd meg a tokenhasználat és a futásidő méréseit
Mért eredmények
Fordulóról fordulóra.
A kiindulási alap megőrzi az első kör eredeti eredményeit és mérési dátumait. A következő pont egy újonnan mért kör, nem egy másik hét eredménye.
Nézd meg a rögzített pontszámokat
| Kör | Claude Opus 5 / Claude Opus 5.5 | Claude Sonnet 5 / Claude Sonnet 5.5 | Claude Fable | GPT-6.1 Sol | GPT-6 Astra | GPT-6 Luna |
|---|---|---|---|---|---|---|
| 2026-W41 | 78.5 (Claude Opus 5.5) | 48.1 (Claude Sonnet 5.5) | 74.6 (Claude Fable) | 74.7 (GPT-6.1 Sol) | 73.5 (GPT-6 Astra) | 30.9 (GPT-6 Luna) |
| Kiindulási alap | 75.5 (Claude Opus 5) | 34.3 (Claude Sonnet 5) | 71.2 (Claude Fable) | 70.6 (GPT-6.1 Sol) | 77.5 (GPT-6 Astra) | 45.6 (GPT-6 Luna) |
A benchmarkról
Adj egy AI-nak 150 téglatestet. Kérd meg, hogy ezt építse meg.
Kerek fej. Ívelt szék. Apró asztali lámpa. Mennyire tudja megközelíteni a mintát egy nyelvi modell, ha csak téglatesteket használhat?
- téglatest legfeljebb
- 150
- modell
- 6
- próbálkozás körönként
- 1
Hogyan működik.
Rögzített feladatleírás.
Minden modell ugyanazt az írásos feladatleírást kapja meg a célalakzat méreteivel és színeivel. A teljes feladatleírás nyilvános.
Csak JSON.
A válasz semmi mást nem tartalmaz: legfeljebb 150 téglatestet, a helyzetükkel, méretükkel és színükkel.
Egy próbálkozás.
Közepes gondolkodási ráfordítás, eszközök és újrapróbálkozás nélkül. A tokenfelhasználást és a futásidőt is mérjük.
Rögzített pontozó.
A célalakzattal való térfogati átfedés, a színpontossággal súlyozva, 0-tól 100-ig.
A képlet
térfogati átfedés %-ban × a helyes színű kockák aránya1 cm³-es egységekben mérve. A feladatleírás ujjlenyomata: 08fb5a5773fe89e7. A kiindulási referencia megőrzi az első forduló eredeti eredményeit.
Teljes módszertan és kérdések
Hogyan működik?
A feladatleírás pontos számadatokkal sorolja fel a minta minden alakzatát. Minden modell kizárólag JSON-nal válaszol: legfeljebb 150 téglatestet ad meg, mindegyikhez egy pozíciót, egy méretet és a 11 szín egyikét. Maga a modell semmit sem rajzol. Egy futás pontozásakor a téglatesteket és a mintát ugyanolyan kis kockákból, azonos megvilágítással és kamerabeállítással rendereljük, majd közzétesszük a képeket.
A pontszám a szobor és a minta térfogati átfedése (a metszet és az unió aránya, 1 cm-es kockákban mérve), megszorozva a közös kockák közül a megfelelő színűek arányával. Alakzatonként egy téglatesttel 40 alatti pontszám érhető el; minden alakzatot egyforma szeletekre bontva körülbelül 50 pont. A ferde lábak, a vékony kábelek és a kerek fejek azoknak a modelleknek kedveznek, amelyek megtervezik az egyes téglatestek helyét, az Eltérések nézet pedig minden hiányzó, felesleges és hibás színű kockát megmutat.
Méltányos és megismételhető
A kiindulási alap az eredeti első kör, amelyet a tényleges mérési dátumaival együtt őrzünk meg. Az induláshoz egy második mért kört is kértek. Mindkettőt megjelenítjük; egyiket sem dátumozzuk vissza, és nem választjuk ki közülük a jobbat. A későbbi körök a heti ütemezést követik.
- Minden héten ugyanaz a feladatleírás, pontozóprogram és beállítás. A v3 feladatleírás ujjlenyomata
08fb5a5773fe89e7; bármilyen módosítás új verziót és új diagramot indít. - Minden modell egyszer válaszol, közepes gondolkodási ráfordítással, előfizetéssel bejelentkezve a Claude Code-on vagy a Codexen keresztül, ugyanúgy, ahogyan a VibeiDE futtatja őket. Nincs eszközhasználat, webes hozzáférés, újrapróbálkozás vagy N válasz közül a legjobb kiválasztása.
- A modellek egymás után futnak, soha nem párhuzamosan. Ha 40 percen belül nem érkezik válasz, az eredmény 0 pont.
- A pontozó egy determinisztikus program. Egyetlen modell sem értékel másik modellt.
Olvasd el a teljes feladatleírást (egyszerű szöveg, 7,691 karakter). A modellnevek az egyes CLI-k által kínált aliasok; az oldal a CLI által visszajelzett modellazonosítót rögzíti.
Kérdések
Gyengítik a Claude-ot vagy a GPT-t?
Ez az oldal nem lát bele a szolgáltatók működésébe, de megmutatja, hogy ugyanaz a modellnév idővel eltérő pontszámot ér-e el ugyanazon a rögzített feladaton. A heti egy futtatás egyetlen mintát jelent, ezért a néhány pontos elmozdulást kezeld zajként, a több héten át tartó visszaesést pedig jelzésként.
Miért nem érheti el egyetlen modell sem a 100 pontot?
A minta gömbökből, ellipszoidokból, hengerekből és ferde kapszulákból áll, a válasz viszont csak 150, a koordinátatengelyekhez igazított téglatestet használhat. A téglatestek nem tudják pontosan követni az íveket, ezért minden válaszból hiányzik valamennyi térfogat. A jobb modellek az ívelt részekre fordítják a téglatesteket, így szobraik jobban hasonlítanak a mintához.
Hogyan futtatjuk a modelleket?
Minden modell egyszer kapja meg a feladatleírást a hivatalos parancssori eszközén, a Claude Code-on vagy a Codexen keresztül, szokásos előfizetéssel bejelentkezve, közepes gondolkodási ráfordítással. Az eszközök, az alügynökök, a webes hozzáférés és az újrapróbálkozások ki vannak kapcsolva; az eszközt használó futás 0 pontot kap. A választ determinisztikus program pontozza, nem egy másik modell.
Miért váltott a teszt a v3 verzióra?
Az első két verzióban a modelleknek egy iroda elrendezését kellett megtervezniük. Az első fordulókban a legjobb modellek 100 és 92 pontot értek el, és minden helyes iroda ugyanúgy nézett ki. Ha a legjobb modellek elérik a teszt maximális pontszámát, az nem tudja megmutatni a fejlődést, ha pedig a válaszok egyformán néznek ki, a minőséget sem lehet érzékeltetni. Ezért a v3 olyan szobrot kér, amelynek minősége egy pillantással látható.
Én is kipróbálhatom a feladatot?
Igen. A teljes feladatleírás egyszerű szövegként nyilvánosan elérhető. Másold be bármelyik modellnek, és hasonlítsd össze a válaszát a mintával.