Office-benchmark

Hvilken AI bygger bedst?

Seks modeller. Én opgavebeskrivelse. Ét forsøg hver. Bedømt fra 0 til 100 ud fra det præcise mål.

Rangliste.

Det byggede hver model.

Råt output, visualiseret ud fra den JSON, hver model returnerede. Ét forsøg, ingen nye forsøg.

Uge 2026-W41

Alle skulpturer vises med samme lys, kamera og målestok. Vælg et resultat for at sammenligne det med målet, eller skift til Forskel for at undersøge afvigelserne.

  1. Claude Opus 5.578.5/100Skulptur fra Claude Opus 5.5
  2. GPT-6.1 Sol74.7/100Skulptur fra GPT-6.1 Sol
  3. Claude Fable74.6/100Skulptur fra Claude Fable
  4. GPT-6 Astra73.5/100Skulptur fra GPT-6 Astra
  5. Claude Sonnet 5.548.1/100Skulptur fra Claude Sonnet 5.5
  6. GPT-6 Luna30.9/100Skulptur fra GPT-6 Luna

Kvalitet, tokens og tid

Hvad krævede hvert resultat?

Sammenlign score, det rapporterede samlede antal input- og outputtokens samt den forløbne køretid for den valgte runde. Ræsonnementstokens lægges ikke til igen. Manglende målinger udelades og tælles ikke som nul.

Se målinger af tokens og køretid

Målte resultater

Runde for runde.

Det oprindelige udgangspunkt bevarer resultaterne fra den første runde og de oprindelige måledatoer. Det næste punkt er en ny målt runde, ikke et resultat fra en anden uge.

Se de registrerede scorer
Score ud af 100 pr. runde
RundeClaude Opus 5 / Claude Opus 5.5Claude Sonnet 5 / Claude Sonnet 5.5Claude FableGPT-6.1 SolGPT-6 AstraGPT-6 Luna
2026-W4178.5 (Claude Opus 5.5)48.1 (Claude Sonnet 5.5)74.6 (Claude Fable)74.7 (GPT-6.1 Sol)73.5 (GPT-6 Astra)30.9 (GPT-6 Luna)
Oprindeligt udgangspunkt75.5 (Claude Opus 5)34.3 (Claude Sonnet 5)71.2 (Claude Fable)70.6 (GPT-6.1 Sol)77.5 (GPT-6 Astra)45.6 (GPT-6 Luna)

Om benchmarken

Giv en AI 150 kasser. Bed den om at bygge dette.

Et rundt hoved. En buet stol. En lille skrivebordslampe. Hvor tæt kan en sprogmodel komme med kun rektangulære klodser?

Målet: en hvid robot på en grøn stol ved et rundt skrivebord med en skærm, lampe, et krus og en plante
Skulpturen, der skal genskabes. 56 former.
kasser som maksimum
150
modeller
6
forsøg pr. runde
1

Sådan fungerer det.

En fastlåst opgavebeskrivelse.

Alle modeller modtager den samme skriftlige opgavebeskrivelse med målene og farverne på det, de skal bygge. Hele opgavebeskrivelsen er offentlig.

Kun JSON.

Svaret indeholder intet andet: op til 150 kasser med positioner, størrelser og farver.

Ét forsøg.

Middel ræsonneringsindsats, ingen værktøjer, ingen nye forsøg. Tokenforbrug og køretid registreres.

En fastlåst beregning af scoren.

Volumenoverlap med målet, vægtet efter farvenøjagtighed, fra 0 til 100.

Formlen

volumenoverlap i % × andelen af korrekt farvede terninger

Målt i enheder på 1 cm³. Opgavebeskrivelsens fingeraftryk 08fb5a5773fe89e7. Udgangspunktet for sammenligningen bevarer de oprindelige resultater fra første runde.

Den fulde metode og spørgsmål

Sådan fungerer det

Opgavebeskrivelsen angiver alle målfigurens former med præcise tal. Hver model svarer kun med JSON: op til 150 kasser, hver med en position, en størrelse og én af 11 farver. Modellen tegner ikke selv noget. Når vi beregner scoren for en kørsel, renderer vi modellens kasser og målfiguren med de samme små terninger, samme belysning og samme kamera og offentliggør billederne.

Scoren er volumenoverlappet mellem skulpturen og målskulpturen (forholdet mellem fællesmængden og foreningsmængden, målt i terninger på 1 cm) ganget med andelen af fælles terninger med den rigtige farve. Én kasse pr. form giver under 40 point; at skære hver form op i lige tykke skiver giver omkring 50 point. Skråtstillede ben, tynde kabler og runde hoveder belønner modeller, der planlægger, hvor hver kasse skal placeres, og visningen Forskel viser hver eneste manglende, ekstra og forkert farvede terning.

Fair og reproducerbart

Det oprindelige udgangspunkt er den oprindelige første runde, bevaret med de faktiske måledatoer. Der blev anmodet om en anden målt runde til lanceringen. Begge vises; ingen af dem er tilbagedateret eller udvalgt som det bedste af to resultater. Senere runder følger den ugentlige tidsplan.

  • Samme opgavebeskrivelse, samme bedømmelsesprogram og samme indstillinger hver uge. Opgavebeskrivelse v3 har fingeraftrykket 08fb5a5773fe89e7; enhver ændring starter en ny version og et nyt diagram.
  • Hver model svarer én gang med et mellemstort ræsonneringsniveau gennem Claude Code eller Codex, logget ind med et abonnement, på samme måde som VibeiDE kører dem. Ingen værktøjer, ingen webadgang, ingen gentagne forsøg og ingen udvælgelse af det bedste blandt N forsøg.
  • Modellerne køres efter hinanden, aldrig parallelt. Et svar, der ikke kommer inden for 40 minutter, får 0 point.
  • Bedømmelsesprogrammet er deterministisk. Ingen model bedømmer en anden model.

Læs hele opgavebeskrivelsen (ren tekst, 7,691 tegn). Modelnavnene er de aliaser, som hvert CLI tilbyder; siden registrerer det model-id, som CLI'et rapporterede.

Spørgsmål

Bliver Claude eller GPT gjort dårligere?

Denne side kan ikke se, hvad der sker internt hos en udbyder, men den viser, om det samme modelnavn får forskellige scorer på den samme fastlåste opgave over tid. Én kørsel om ugen er en enkelt måling, så betragt en ændring på få point som støj og et fald, der varer flere uger, som et signal.

Hvorfor kan ingen model nå 100?

Målskulpturen består af kugler, ellipsoider, cylindre og skråtstillede kapsler, og svaret må kun bruge 150 akseparallelle kasser. Kasser kan ikke følge kurver præcist, så hvert svar mister noget volumen. Bedre modeller bruger deres kasser dér, hvor kurverne er, og deres skulpturer ligner målskulpturen mere.

Hvordan køres modellerne?

Hver model får opgavebeskrivelsen én gang via sit officielle kommandolinjeværktøj, Claude Code eller Codex, logget ind med et almindeligt abonnement og med ræsonnementsindsatsen indstillet til medium. Værktøjer, underagenter, webadgang og gentagne forsøg er slået fra; en kørsel, der bruger et værktøj, får 0 point. Svaret bedømmes af et deterministisk program, ikke af en anden model.

Hvorfor blev benchmarken ændret til v3?

De første to versioner bad modellerne om at indrette et kontor. I deres første runder fik de bedste modeller 100 og 92 point, og alle korrekt indrettede kontorer så ens ud. En benchmark, hvor topmodellerne når loftet, kan ikke vise udvikling, og en benchmark, hvor svarene ligner hinanden, kan ikke vise kvalitet. Derfor beder v3 om en skulptur, hvis kvalitet kan ses med det samme.

Kan jeg selv prøve opgaven?

Ja. Hele opgavebeskrivelsen er offentligt tilgængelig som ren tekst. Indsæt den i en hvilken som helst model, og sammenlign dens svar med målskulpturen.

Sprog

Necessary cookies support sign-in, security, your language and this choice. Optional categories stay off until accepted.

First-party page views and acquisition measurement, plus Google Analytics 4 (Google Ireland, data may reach the US). Advertising personalization stays off.

With Analytics enabled, retain Google and Microsoft ad click identifiers and share download, signup, activation and purchase conversions with the relevant ad provider. No personalized advertising.

Remember referral credit for later. Links still work on the current page without this cookie.

Privacy · Cookie inventory