Office-benchmark

Vilken AI bygger bäst?

Sex modeller. En uppgiftsbeskrivning. Ett försök var. Poäng från 0 till 100 utifrån hur väl resultatet matchar målformen.

Topplistan.

Vad varje modell byggde.

Obearbetade resultat, renderade från den JSON varje modell returnerade. Ett försök, inga omförsök.

Vecka 2026-W41

Alla skulpturer visas med samma ljus, kamera och skala. Välj ett resultat för att jämföra det med målet, eller växla till Skillnad för att granska avvikelserna.

  1. Claude Opus 5.578.5/100Skulptur av Claude Opus 5.5
  2. GPT-6.1 Sol74.7/100Skulptur av GPT-6.1 Sol
  3. Claude Fable74.6/100Skulptur av Claude Fable
  4. GPT-6 Astra73.5/100Skulptur av GPT-6 Astra
  5. Claude Sonnet 5.548.1/100Skulptur av Claude Sonnet 5.5
  6. GPT-6 Luna30.9/100Skulptur av GPT-6 Luna

Kvalitet, token och tid

Vilka resurser krävde varje resultat?

Jämför poäng, rapporterat antal in- och utdata-token samt förfluten körtid för den valda omgången. Resonemangstoken läggs inte till en gång till. Saknade mätvärden utelämnas och räknas inte som noll.

Visa mätningar av token och körtid

Uppmätta resultat

Omgång för omgång.

Den ursprungliga baslinjen bevarar resultaten från den första omgången och dess mätdatum. Nästa punkt är en ny uppmätt omgång, inte ett resultat från en annan vecka.

Visa de registrerade poängen
Poäng av 100 per omgång
OmgångClaude Opus 5 / Claude Opus 5.5Claude Sonnet 5 / Claude Sonnet 5.5Claude FableGPT-6.1 SolGPT-6 AstraGPT-6 Luna
2026-W4178.5 (Claude Opus 5.5)48.1 (Claude Sonnet 5.5)74.6 (Claude Fable)74.7 (GPT-6.1 Sol)73.5 (GPT-6 Astra)30.9 (GPT-6 Luna)
Ursprunglig baslinje75.5 (Claude Opus 5)34.3 (Claude Sonnet 5)71.2 (Claude Fable)70.6 (GPT-6.1 Sol)77.5 (GPT-6 Astra)45.6 (GPT-6 Luna)

Om benchmarken

Ge en AI 150 lådor. Be om det här.

Ett runt huvud. En böjd stol. En liten skrivbordslampa. Hur nära kan en språkmodell komma med enbart rätblock?

Målet: en vit robot på en grön stol vid ett runt skrivbord med en bildskärm, en lampa, en mugg och en växt
Skulpturen som ska återskapas. 56 former.
lådor som mest
150
modeller
6
försök per omgång
1

Så fungerar det.

En fast uppgiftsbeskrivning.

Varje modell får samma skriftliga uppgiftsbeskrivning med målformens mått och färger. Hela uppgiftsbeskrivningen är offentlig.

Endast JSON.

Svaret innehåller inget annat: upp till 150 lådor med positioner, storlekar och färger.

Ett försök.

Medelhög resonemangsnivå, inga verktyg, inga omförsök. Tokenförbrukning och körtid registreras.

En fast poängberäkning.

Volymöverlappning med målformen, viktad efter hur väl färgerna stämmer, från 0 till 100.

Formeln

volymöverlappning i % × andel korrekt färgade kuber

Mäts i enheter om 1 cm³. Uppgiftsbeskrivningens fingeravtryck 08fb5a5773fe89e7. Den ursprungliga baslinjen bevarar resultaten från den första omgången.

Fullständig metodbeskrivning och frågor

Så fungerar det

Uppgiftsbeskrivningen listar varje form i förlagan med exakta siffervärden. Varje modell svarar enbart med JSON: upp till 150 rätblock, vart och ett med en position, en storlek och en av 11 färger. Modellen ritar ingenting själv. När en körning poängsätts renderar vi modellens rätblock och förlagan med samma små kuber, samma ljussättning och samma kamera och publicerar bilderna.

Poängen beräknas som volymöverlappningen mellan skulpturen och förlagan (snittet delat med unionen, mätt i kuber på 1 cm) multiplicerad med andelen gemensamma kuber som har rätt färg. Ett rätblock per form ger under 40 poäng. Att dela varje form i lika tjocka skivor ger omkring 50 poäng. Lutande ben, tunna kablar och runda huvuden belönar modeller som planerar var varje rätblock ska placeras, och vyn Skillnad visar varje kub som saknas, är extra eller har fel färg.

Rättvist och upprepningsbart

Den ursprungliga baslinjen är den första omgången, bevarad med sina faktiska mätdatum. En andra uppmätt omgång begärdes inför lanseringen. Båda visas; ingen av dem har bakdaterats eller valts ut som det bästa av två resultat. Senare omgångar följer veckoschemat.

  • Samma uppgift, samma poängsättningsprogram och samma inställningar varje vecka. Uppgift v3 har fingeravtrycket 08fb5a5773fe89e7. Varje ändring innebär en ny version och ett nytt diagram.
  • Varje modell svarar en gång med medelhög resonemangsinsats via Claude Code eller Codex, inloggad med ett abonnemang, på samma sätt som VibeiDE kör dem. Inga verktyg, ingen webbåtkomst, inga nya försök och inget urval av det bästa av N svar.
  • Modellerna körs efter varandra, aldrig parallellt. Ett svar som inte kommer inom 40 minuter får 0 poäng.
  • Poängsättningsprogrammet är deterministiskt. Ingen modell bedömer en annan modell.

Läs hela uppgiften (ren text, 7,691 tecken). Modellnamnen är de alias som respektive CLI erbjuder. Sidan registrerar den modellidentifierare som CLI rapporterade.

Frågor

Blir Claude eller GPT sämre?

Den här sidan kan inte se vad som händer internt hos en leverantör, men den visar om samma modellnamn får olika poäng på samma oförändrade uppgift över tid. En körning per vecka är ett enda stickprov, så betrakta en förändring på några poäng som brus och en nedgång som håller i sig flera veckor som en signal.

Varför kan ingen modell nå 100?

Förlagan består av sfärer, ellipsoider, cylindrar och lutande kapslar, men svaret får bara använda 150 axelparallella rätblock. Rätblock kan inte följa kurvor exakt, så varje svar tappar en del volym. Bättre modeller använder sina rätblock där kurvorna finns, och deras skulpturer liknar förlagan mer.

Hur körs modellerna?

Varje modell får uppgiften en gång via sitt officiella kommandoradsverktyg, Claude Code eller Codex, inloggad med en vanlig prenumeration och med resonemangsnivån medium. Verktyg, underagenter, webbåtkomst och nya försök är avstängda. En körning som använder ett verktyg får 0 poäng. Svaret poängsätts av ett deterministiskt program, inte av en annan modell.

Varför ändrades jämförelsetestet till v3?

I de första två versionerna fick modellerna utforma ett kontor. I de första omgångarna fick de bästa modellerna 100 respektive 92 poäng, och alla korrekta kontor såg likadana ut. Ett jämförelsetest där toppmodellerna når maxpoäng kan inte visa förändring, och ett där svaren ser likadana ut kan inte visa kvalitet. Därför efterfrågar v3 en skulptur vars kvalitet syns direkt.

Kan jag prova uppgiften själv?

Ja. Hela uppgiften är offentligt tillgänglig som ren text. Klistra in den i valfri modell och jämför svaret med förlagan.

Språk

Necessary cookies support sign-in, security, your language and this choice. Optional categories stay off until accepted.

First-party page views and acquisition measurement, plus Google Analytics 4 (Google Ireland, data may reach the US). Advertising personalization stays off.

With Analytics enabled, retain Google and Microsoft ad click identifiers and share download, signup, activation and purchase conversions with the relevant ad provider. No personalized advertising.

Remember referral credit for later. Links still work on the current page without this cookie.

Privacy · Cookie inventory