Office-benchmark
Vilken AI bygger bäst?
Sex modeller. En uppgiftsbeskrivning. Ett försök var. Poäng från 0 till 100 utifrån hur väl resultatet matchar målformen.
Topplistan.
Vad varje modell byggde.
Obearbetade resultat, renderade från den JSON varje modell returnerade. Ett försök, inga omförsök.
Alla skulpturer visas med samma ljus, kamera och skala. Välj ett resultat för att jämföra det med målet, eller växla till Skillnad för att granska avvikelserna.
Anteckningar
Kvalitet, token och tid
Vilka resurser krävde varje resultat?
Jämför poäng, rapporterat antal in- och utdata-token samt förfluten körtid för den valda omgången. Resonemangstoken läggs inte till en gång till. Saknade mätvärden utelämnas och räknas inte som noll.
Visa mätningar av token och körtid
Uppmätta resultat
Omgång för omgång.
Den ursprungliga baslinjen bevarar resultaten från den första omgången och dess mätdatum. Nästa punkt är en ny uppmätt omgång, inte ett resultat från en annan vecka.
Visa de registrerade poängen
| Omgång | Claude Opus 5 / Claude Opus 5.5 | Claude Sonnet 5 / Claude Sonnet 5.5 | Claude Fable | GPT-6.1 Sol | GPT-6 Astra | GPT-6 Luna |
|---|---|---|---|---|---|---|
| 2026-W41 | 78.5 (Claude Opus 5.5) | 48.1 (Claude Sonnet 5.5) | 74.6 (Claude Fable) | 74.7 (GPT-6.1 Sol) | 73.5 (GPT-6 Astra) | 30.9 (GPT-6 Luna) |
| Ursprunglig baslinje | 75.5 (Claude Opus 5) | 34.3 (Claude Sonnet 5) | 71.2 (Claude Fable) | 70.6 (GPT-6.1 Sol) | 77.5 (GPT-6 Astra) | 45.6 (GPT-6 Luna) |
Om benchmarken
Ge en AI 150 lådor. Be om det här.
Ett runt huvud. En böjd stol. En liten skrivbordslampa. Hur nära kan en språkmodell komma med enbart rätblock?
- lådor som mest
- 150
- modeller
- 6
- försök per omgång
- 1
Så fungerar det.
En fast uppgiftsbeskrivning.
Varje modell får samma skriftliga uppgiftsbeskrivning med målformens mått och färger. Hela uppgiftsbeskrivningen är offentlig.
Endast JSON.
Svaret innehåller inget annat: upp till 150 lådor med positioner, storlekar och färger.
Ett försök.
Medelhög resonemangsnivå, inga verktyg, inga omförsök. Tokenförbrukning och körtid registreras.
En fast poängberäkning.
Volymöverlappning med målformen, viktad efter hur väl färgerna stämmer, från 0 till 100.
Formeln
volymöverlappning i % × andel korrekt färgade kuberMäts i enheter om 1 cm³. Uppgiftsbeskrivningens fingeravtryck 08fb5a5773fe89e7. Den ursprungliga baslinjen bevarar resultaten från den första omgången.
Fullständig metodbeskrivning och frågor
Så fungerar det
Uppgiftsbeskrivningen listar varje form i förlagan med exakta siffervärden. Varje modell svarar enbart med JSON: upp till 150 rätblock, vart och ett med en position, en storlek och en av 11 färger. Modellen ritar ingenting själv. När en körning poängsätts renderar vi modellens rätblock och förlagan med samma små kuber, samma ljussättning och samma kamera och publicerar bilderna.
Poängen beräknas som volymöverlappningen mellan skulpturen och förlagan (snittet delat med unionen, mätt i kuber på 1 cm) multiplicerad med andelen gemensamma kuber som har rätt färg. Ett rätblock per form ger under 40 poäng. Att dela varje form i lika tjocka skivor ger omkring 50 poäng. Lutande ben, tunna kablar och runda huvuden belönar modeller som planerar var varje rätblock ska placeras, och vyn Skillnad visar varje kub som saknas, är extra eller har fel färg.
Rättvist och upprepningsbart
Den ursprungliga baslinjen är den första omgången, bevarad med sina faktiska mätdatum. En andra uppmätt omgång begärdes inför lanseringen. Båda visas; ingen av dem har bakdaterats eller valts ut som det bästa av två resultat. Senare omgångar följer veckoschemat.
- Samma uppgift, samma poängsättningsprogram och samma inställningar varje vecka. Uppgift v3 har fingeravtrycket
08fb5a5773fe89e7. Varje ändring innebär en ny version och ett nytt diagram. - Varje modell svarar en gång med medelhög resonemangsinsats via Claude Code eller Codex, inloggad med ett abonnemang, på samma sätt som VibeiDE kör dem. Inga verktyg, ingen webbåtkomst, inga nya försök och inget urval av det bästa av N svar.
- Modellerna körs efter varandra, aldrig parallellt. Ett svar som inte kommer inom 40 minuter får 0 poäng.
- Poängsättningsprogrammet är deterministiskt. Ingen modell bedömer en annan modell.
Läs hela uppgiften (ren text, 7,691 tecken). Modellnamnen är de alias som respektive CLI erbjuder. Sidan registrerar den modellidentifierare som CLI rapporterade.
Frågor
Blir Claude eller GPT sämre?
Den här sidan kan inte se vad som händer internt hos en leverantör, men den visar om samma modellnamn får olika poäng på samma oförändrade uppgift över tid. En körning per vecka är ett enda stickprov, så betrakta en förändring på några poäng som brus och en nedgång som håller i sig flera veckor som en signal.
Varför kan ingen modell nå 100?
Förlagan består av sfärer, ellipsoider, cylindrar och lutande kapslar, men svaret får bara använda 150 axelparallella rätblock. Rätblock kan inte följa kurvor exakt, så varje svar tappar en del volym. Bättre modeller använder sina rätblock där kurvorna finns, och deras skulpturer liknar förlagan mer.
Hur körs modellerna?
Varje modell får uppgiften en gång via sitt officiella kommandoradsverktyg, Claude Code eller Codex, inloggad med en vanlig prenumeration och med resonemangsnivån medium. Verktyg, underagenter, webbåtkomst och nya försök är avstängda. En körning som använder ett verktyg får 0 poäng. Svaret poängsätts av ett deterministiskt program, inte av en annan modell.
Varför ändrades jämförelsetestet till v3?
I de första två versionerna fick modellerna utforma ett kontor. I de första omgångarna fick de bästa modellerna 100 respektive 92 poäng, och alla korrekta kontor såg likadana ut. Ett jämförelsetest där toppmodellerna når maxpoäng kan inte visa förändring, och ett där svaren ser likadana ut kan inte visa kvalitet. Därför efterfrågar v3 en skulptur vars kvalitet syns direkt.
Kan jag prova uppgiften själv?
Ja. Hela uppgiften är offentligt tillgänglig som ren text. Klistra in den i valfri modell och jämför svaret med förlagan.