Office-benchmark
Hvilken AI bygger bedst?
Seks modeller. Én opgavebeskrivelse. Ét forsøg hver. Bedømt fra 0 til 100 ud fra det præcise mål.
Rangliste.
Det byggede hver model.
Råt output, visualiseret ud fra den JSON, hver model returnerede. Ét forsøg, ingen nye forsøg.
Alle skulpturer vises med samme lys, kamera og målestok. Vælg et resultat for at sammenligne det med målet, eller skift til Forskel for at undersøge afvigelserne.
Noter
Kvalitet, tokens og tid
Hvad krævede hvert resultat?
Sammenlign score, det rapporterede samlede antal input- og outputtokens samt den forløbne køretid for den valgte runde. Ræsonnementstokens lægges ikke til igen. Manglende målinger udelades og tælles ikke som nul.
Se målinger af tokens og køretid
Målte resultater
Runde for runde.
Det oprindelige udgangspunkt bevarer resultaterne fra den første runde og de oprindelige måledatoer. Det næste punkt er en ny målt runde, ikke et resultat fra en anden uge.
Se de registrerede scorer
| Runde | Claude Opus 5 / Claude Opus 5.5 | Claude Sonnet 5 / Claude Sonnet 5.5 | Claude Fable | GPT-6.1 Sol | GPT-6 Astra | GPT-6 Luna |
|---|---|---|---|---|---|---|
| 2026-W41 | 78.5 (Claude Opus 5.5) | 48.1 (Claude Sonnet 5.5) | 74.6 (Claude Fable) | 74.7 (GPT-6.1 Sol) | 73.5 (GPT-6 Astra) | 30.9 (GPT-6 Luna) |
| Oprindeligt udgangspunkt | 75.5 (Claude Opus 5) | 34.3 (Claude Sonnet 5) | 71.2 (Claude Fable) | 70.6 (GPT-6.1 Sol) | 77.5 (GPT-6 Astra) | 45.6 (GPT-6 Luna) |
Om benchmarken
Giv en AI 150 kasser. Bed den om at bygge dette.
Et rundt hoved. En buet stol. En lille skrivebordslampe. Hvor tæt kan en sprogmodel komme med kun rektangulære klodser?
- kasser som maksimum
- 150
- modeller
- 6
- forsøg pr. runde
- 1
Sådan fungerer det.
En fastlåst opgavebeskrivelse.
Alle modeller modtager den samme skriftlige opgavebeskrivelse med målene og farverne på det, de skal bygge. Hele opgavebeskrivelsen er offentlig.
Kun JSON.
Svaret indeholder intet andet: op til 150 kasser med positioner, størrelser og farver.
Ét forsøg.
Middel ræsonneringsindsats, ingen værktøjer, ingen nye forsøg. Tokenforbrug og køretid registreres.
En fastlåst beregning af scoren.
Volumenoverlap med målet, vægtet efter farvenøjagtighed, fra 0 til 100.
Formlen
volumenoverlap i % × andelen af korrekt farvede terningerMålt i enheder på 1 cm³. Opgavebeskrivelsens fingeraftryk 08fb5a5773fe89e7. Udgangspunktet for sammenligningen bevarer de oprindelige resultater fra første runde.
Den fulde metode og spørgsmål
Sådan fungerer det
Opgavebeskrivelsen angiver alle målfigurens former med præcise tal. Hver model svarer kun med JSON: op til 150 kasser, hver med en position, en størrelse og én af 11 farver. Modellen tegner ikke selv noget. Når vi beregner scoren for en kørsel, renderer vi modellens kasser og målfiguren med de samme små terninger, samme belysning og samme kamera og offentliggør billederne.
Scoren er volumenoverlappet mellem skulpturen og målskulpturen (forholdet mellem fællesmængden og foreningsmængden, målt i terninger på 1 cm) ganget med andelen af fælles terninger med den rigtige farve. Én kasse pr. form giver under 40 point; at skære hver form op i lige tykke skiver giver omkring 50 point. Skråtstillede ben, tynde kabler og runde hoveder belønner modeller, der planlægger, hvor hver kasse skal placeres, og visningen Forskel viser hver eneste manglende, ekstra og forkert farvede terning.
Fair og reproducerbart
Det oprindelige udgangspunkt er den oprindelige første runde, bevaret med de faktiske måledatoer. Der blev anmodet om en anden målt runde til lanceringen. Begge vises; ingen af dem er tilbagedateret eller udvalgt som det bedste af to resultater. Senere runder følger den ugentlige tidsplan.
- Samme opgavebeskrivelse, samme bedømmelsesprogram og samme indstillinger hver uge. Opgavebeskrivelse v3 har fingeraftrykket
08fb5a5773fe89e7; enhver ændring starter en ny version og et nyt diagram. - Hver model svarer én gang med et mellemstort ræsonneringsniveau gennem Claude Code eller Codex, logget ind med et abonnement, på samme måde som VibeiDE kører dem. Ingen værktøjer, ingen webadgang, ingen gentagne forsøg og ingen udvælgelse af det bedste blandt N forsøg.
- Modellerne køres efter hinanden, aldrig parallelt. Et svar, der ikke kommer inden for 40 minutter, får 0 point.
- Bedømmelsesprogrammet er deterministisk. Ingen model bedømmer en anden model.
Læs hele opgavebeskrivelsen (ren tekst, 7,691 tegn). Modelnavnene er de aliaser, som hvert CLI tilbyder; siden registrerer det model-id, som CLI'et rapporterede.
Spørgsmål
Bliver Claude eller GPT gjort dårligere?
Denne side kan ikke se, hvad der sker internt hos en udbyder, men den viser, om det samme modelnavn får forskellige scorer på den samme fastlåste opgave over tid. Én kørsel om ugen er en enkelt måling, så betragt en ændring på få point som støj og et fald, der varer flere uger, som et signal.
Hvorfor kan ingen model nå 100?
Målskulpturen består af kugler, ellipsoider, cylindre og skråtstillede kapsler, og svaret må kun bruge 150 akseparallelle kasser. Kasser kan ikke følge kurver præcist, så hvert svar mister noget volumen. Bedre modeller bruger deres kasser dér, hvor kurverne er, og deres skulpturer ligner målskulpturen mere.
Hvordan køres modellerne?
Hver model får opgavebeskrivelsen én gang via sit officielle kommandolinjeværktøj, Claude Code eller Codex, logget ind med et almindeligt abonnement og med ræsonnementsindsatsen indstillet til medium. Værktøjer, underagenter, webadgang og gentagne forsøg er slået fra; en kørsel, der bruger et værktøj, får 0 point. Svaret bedømmes af et deterministisk program, ikke af en anden model.
Hvorfor blev benchmarken ændret til v3?
De første to versioner bad modellerne om at indrette et kontor. I deres første runder fik de bedste modeller 100 og 92 point, og alle korrekt indrettede kontorer så ens ud. En benchmark, hvor topmodellerne når loftet, kan ikke vise udvikling, og en benchmark, hvor svarene ligner hinanden, kan ikke vise kvalitet. Derfor beder v3 om en skulptur, hvis kvalitet kan ses med det samme.
Kan jeg selv prøve opgaven?
Ja. Hele opgavebeskrivelsen er offentligt tilgængelig som ren tekst. Indsæt den i en hvilken som helst model, og sammenlign dens svar med målskulpturen.