Irodai benchmark

Melyik AI épít a legjobban?

Hat modell. Egy feladatleírás. Mindegyiknek egy próbálkozás. Pontozás 0-tól 100-ig, a pontos célalakzathoz viszonyítva.

Ranglista.

Mit építettek az egyes modellek.

Nyers kimenet, az egyes modellek által visszaadott JSON alapján megjelenítve. Egy próbálkozás, újrapróbálkozás nélkül.

2026-W41 hét

Minden szobornál azonos a megvilágítás, a kamera és a méretarány. Válassz ki egy eredményt, hogy összehasonlíthasd a mintával, vagy válts a Különbség nézetre az eltérések megvizsgálásához.

  1. Claude Opus 5.578.5/100A Claude Opus 5.5 szobra
  2. GPT-6.1 Sol74.7/100A GPT-6.1 Sol szobra
  3. Claude Fable74.6/100A Claude Fable szobra
  4. GPT-6 Astra73.5/100A GPT-6 Astra szobra
  5. Claude Sonnet 5.548.1/100A Claude Sonnet 5.5 szobra
  6. GPT-6 Luna30.9/100A GPT-6 Luna szobra

Minőség, tokenek és idő

Mennyi erőforrást igényelt egy-egy eredmény?

Hasonlítsd össze a kiválasztott kör pontszámát, a jelentett bemeneti és kimeneti tokenek összegét, valamint a futásidőt. A gondolkodási tokeneket nem adjuk hozzá még egyszer. A hiányzó méréseket kihagyjuk, nem számítjuk nullának.

Nézd meg a tokenhasználat és a futásidő méréseit

Mért eredmények

Fordulóról fordulóra.

A kiindulási alap megőrzi az első kör eredeti eredményeit és mérési dátumait. A következő pont egy újonnan mért kör, nem egy másik hét eredménye.

Nézd meg a rögzített pontszámokat
Pontszám körönként, 100 pontos skálán
KörClaude Opus 5 / Claude Opus 5.5Claude Sonnet 5 / Claude Sonnet 5.5Claude FableGPT-6.1 SolGPT-6 AstraGPT-6 Luna
2026-W4178.5 (Claude Opus 5.5)48.1 (Claude Sonnet 5.5)74.6 (Claude Fable)74.7 (GPT-6.1 Sol)73.5 (GPT-6 Astra)30.9 (GPT-6 Luna)
Kiindulási alap75.5 (Claude Opus 5)34.3 (Claude Sonnet 5)71.2 (Claude Fable)70.6 (GPT-6.1 Sol)77.5 (GPT-6 Astra)45.6 (GPT-6 Luna)

A benchmarkról

Adj egy AI-nak 150 téglatestet. Kérd meg, hogy ezt építse meg.

Kerek fej. Ívelt szék. Apró asztali lámpa. Mennyire tudja megközelíteni a mintát egy nyelvi modell, ha csak téglatesteket használhat?

A cél: fehér robot egy zöld széken, egy kerek asztalnál, amelyen monitor, lámpa, bögre és növény van
Az újraalkotandó szobor. 56 alakzat.
téglatest legfeljebb
150
modell
6
próbálkozás körönként
1

Hogyan működik.

Rögzített feladatleírás.

Minden modell ugyanazt az írásos feladatleírást kapja meg a célalakzat méreteivel és színeivel. A teljes feladatleírás nyilvános.

Csak JSON.

A válasz semmi mást nem tartalmaz: legfeljebb 150 téglatestet, a helyzetükkel, méretükkel és színükkel.

Egy próbálkozás.

Közepes gondolkodási ráfordítás, eszközök és újrapróbálkozás nélkül. A tokenfelhasználást és a futásidőt is mérjük.

Rögzített pontozó.

A célalakzattal való térfogati átfedés, a színpontossággal súlyozva, 0-tól 100-ig.

A képlet

térfogati átfedés %-ban × a helyes színű kockák aránya

1 cm³-es egységekben mérve. A feladatleírás ujjlenyomata: 08fb5a5773fe89e7. A kiindulási referencia megőrzi az első forduló eredeti eredményeit.

Teljes módszertan és kérdések

Hogyan működik?

A feladatleírás pontos számadatokkal sorolja fel a minta minden alakzatát. Minden modell kizárólag JSON-nal válaszol: legfeljebb 150 téglatestet ad meg, mindegyikhez egy pozíciót, egy méretet és a 11 szín egyikét. Maga a modell semmit sem rajzol. Egy futás pontozásakor a téglatesteket és a mintát ugyanolyan kis kockákból, azonos megvilágítással és kamerabeállítással rendereljük, majd közzétesszük a képeket.

A pontszám a szobor és a minta térfogati átfedése (a metszet és az unió aránya, 1 cm-es kockákban mérve), megszorozva a közös kockák közül a megfelelő színűek arányával. Alakzatonként egy téglatesttel 40 alatti pontszám érhető el; minden alakzatot egyforma szeletekre bontva körülbelül 50 pont. A ferde lábak, a vékony kábelek és a kerek fejek azoknak a modelleknek kedveznek, amelyek megtervezik az egyes téglatestek helyét, az Eltérések nézet pedig minden hiányzó, felesleges és hibás színű kockát megmutat.

Méltányos és megismételhető

A kiindulási alap az eredeti első kör, amelyet a tényleges mérési dátumaival együtt őrzünk meg. Az induláshoz egy második mért kört is kértek. Mindkettőt megjelenítjük; egyiket sem dátumozzuk vissza, és nem választjuk ki közülük a jobbat. A későbbi körök a heti ütemezést követik.

  • Minden héten ugyanaz a feladatleírás, pontozóprogram és beállítás. A v3 feladatleírás ujjlenyomata 08fb5a5773fe89e7; bármilyen módosítás új verziót és új diagramot indít.
  • Minden modell egyszer válaszol, közepes gondolkodási ráfordítással, előfizetéssel bejelentkezve a Claude Code-on vagy a Codexen keresztül, ugyanúgy, ahogyan a VibeiDE futtatja őket. Nincs eszközhasználat, webes hozzáférés, újrapróbálkozás vagy N válasz közül a legjobb kiválasztása.
  • A modellek egymás után futnak, soha nem párhuzamosan. Ha 40 percen belül nem érkezik válasz, az eredmény 0 pont.
  • A pontozó egy determinisztikus program. Egyetlen modell sem értékel másik modellt.

Olvasd el a teljes feladatleírást (egyszerű szöveg, 7,691 karakter). A modellnevek az egyes CLI-k által kínált aliasok; az oldal a CLI által visszajelzett modellazonosítót rögzíti.

Kérdések

Gyengítik a Claude-ot vagy a GPT-t?

Ez az oldal nem lát bele a szolgáltatók működésébe, de megmutatja, hogy ugyanaz a modellnév idővel eltérő pontszámot ér-e el ugyanazon a rögzített feladaton. A heti egy futtatás egyetlen mintát jelent, ezért a néhány pontos elmozdulást kezeld zajként, a több héten át tartó visszaesést pedig jelzésként.

Miért nem érheti el egyetlen modell sem a 100 pontot?

A minta gömbökből, ellipszoidokból, hengerekből és ferde kapszulákból áll, a válasz viszont csak 150, a koordinátatengelyekhez igazított téglatestet használhat. A téglatestek nem tudják pontosan követni az íveket, ezért minden válaszból hiányzik valamennyi térfogat. A jobb modellek az ívelt részekre fordítják a téglatesteket, így szobraik jobban hasonlítanak a mintához.

Hogyan futtatjuk a modelleket?

Minden modell egyszer kapja meg a feladatleírást a hivatalos parancssori eszközén, a Claude Code-on vagy a Codexen keresztül, szokásos előfizetéssel bejelentkezve, közepes gondolkodási ráfordítással. Az eszközök, az alügynökök, a webes hozzáférés és az újrapróbálkozások ki vannak kapcsolva; az eszközt használó futás 0 pontot kap. A választ determinisztikus program pontozza, nem egy másik modell.

Miért váltott a teszt a v3 verzióra?

Az első két verzióban a modelleknek egy iroda elrendezését kellett megtervezniük. Az első fordulókban a legjobb modellek 100 és 92 pontot értek el, és minden helyes iroda ugyanúgy nézett ki. Ha a legjobb modellek elérik a teszt maximális pontszámát, az nem tudja megmutatni a fejlődést, ha pedig a válaszok egyformán néznek ki, a minőséget sem lehet érzékeltetni. Ezért a v3 olyan szobrot kér, amelynek minősége egy pillantással látható.

Én is kipróbálhatom a feladatot?

Igen. A teljes feladatleírás egyszerű szövegként nyilvánosan elérhető. Másold be bármelyik modellnek, és hasonlítsd össze a válaszát a mintával.

Nyelvek

Necessary cookies support sign-in, security, your language and this choice. Optional categories stay off until accepted.

First-party page views and acquisition measurement, plus Google Analytics 4 (Google Ireland, data may reach the US). Advertising personalization stays off.

With Analytics enabled, retain Google and Microsoft ad click identifiers and share download, signup, activation and purchase conversions with the relevant ad provider. No personalized advertising.

Remember referral credit for later. Links still work on the current page without this cookie.

Privacy · Cookie inventory