Kontorbenchmark
Hvilken KI bygger best?
Seks modeller. Én oppgavebeskrivelse. Ett forsøk hver. Poeng fra 0 til 100 basert på samsvar med den nøyaktige målfiguren.
Resultatliste.
Hva hver modell bygde.
Ubehandlet resultat, visualisert fra JSON-dataene hver modell returnerte. Ett forsøk, ingen nye forsøk.
Alle skulpturene bruker samme belysning, kamera og målestokk. Velg et resultat for å sammenligne det med målet, eller bytt til Forskjell for å undersøke avvikene.
Merknader
Kvalitet, tokener og tid
Hva krevde hvert resultat?
Sammenlign poengsum, rapportert sum av inn- og utdatatokener og medgått kjøretid for den valgte runden. Resonneringstokener legges ikke til på nytt. Manglende målinger utelates og regnes ikke som null.
Se målinger av tokenbruk og kjøretid
Målte resultater
Runde for runde.
Den opprinnelige referansen bevarer resultatene og måledatoene fra første runde. Neste punkt er en ny målt runde, ikke et resultat fra en annen uke.
Se de registrerte poengsummene
| Runde | Claude Opus 5 / Claude Opus 5.5 | Claude Sonnet 5 / Claude Sonnet 5.5 | Claude Fable | GPT-6.1 Sol | GPT-6 Astra | GPT-6 Luna |
|---|---|---|---|---|---|---|
| 2026-W41 | 78.5 (Claude Opus 5.5) | 48.1 (Claude Sonnet 5.5) | 74.6 (Claude Fable) | 74.7 (GPT-6.1 Sol) | 73.5 (GPT-6 Astra) | 30.9 (GPT-6 Luna) |
| Opprinnelig referanse | 75.5 (Claude Opus 5) | 34.3 (Claude Sonnet 5) | 71.2 (Claude Fable) | 70.6 (GPT-6.1 Sol) | 77.5 (GPT-6 Astra) | 45.6 (GPT-6 Luna) |
Om benchmarken
Gi en KI 150 bokser. Be om dette.
Et rundt hode. En buet stol. En liten skrivebordslampe. Hvor nær kan en språkmodell komme med bare rektangulære klosser?
- klosser maksimalt
- 150
- modeller
- 6
- forsøk per runde
- 1
Slik fungerer det.
En fast oppgavebeskrivelse.
Alle modellene får den samme skriftlige oppgavebeskrivelsen med målfigurens dimensjoner og farger. Hele oppgavebeskrivelsen er offentlig.
Kun JSON.
Svaret inneholder ingenting annet: opptil 150 bokser med posisjoner, størrelser og farger.
Ett forsøk.
Middels resonneringsinnsats, ingen verktøy, ingen nye forsøk. Tokenbruk og kjøretid registreres.
En fast poengberegning.
Volumoverlapp med målfiguren, vektet etter hvor riktige fargene er, fra 0 til 100.
Formelen
volumoverlapp i % × andel kuber med riktig fargeMålt i enheter på 1 cm³. Oppgavebeskrivelsens fingeravtrykk 08fb5a5773fe89e7. Utgangspunktet bevarer de opprinnelige resultatene fra første runde.
Fullstendig metodikk og spørsmål
Slik fungerer det
Oppgavebeskrivelsen oppgir alle formene i referansefiguren med nøyaktige tall. Hver modell svarer kun med JSON: opptil 150 bokser, hver med en posisjon, en størrelse og én av 11 farger. Modellen tegner ingenting selv. Når en kjøring poengsettes, gjengir vi boksene og referansefiguren med de samme små kubene, samme belysning og samme kamera, og publiserer bildene.
Poengsummen beregnes som volumoverlappet mellom skulpturen og målfiguren (snitt delt på union, målt i kuber på 1 cm), multiplisert med andelen overlappende kuber som har riktig farge. Én boks per form gir under 40 poeng. Å dele hver form i like tykke skiver gir omtrent 50 poeng. Skråstilte ben, tynne kabler og runde hoder belønner modeller som planlegger plasseringen av hver boks, og visningen Forskjell viser hver kube som mangler, er overflødig eller har feil farge.
Rettferdig og repeterbart
Den opprinnelige referansen er den første runden, bevart med de faktiske måledatoene. En ny målt runde ble etterspurt til lanseringen. Begge vises; ingen av dem er tilbakedatert eller valgt ut som det beste av to resultater. Senere runder følger den ukentlige planen.
- Samme oppgave, samme poengberegningsprogram og samme innstillinger hver uke. Oppgave v3 har fingeravtrykket
08fb5a5773fe89e7. Enhver endring starter en ny versjon og et nytt diagram. - Hver modell svarer én gang med middels resonneringsinnsats, gjennom Claude Code eller Codex innlogget med et abonnement, på samme måte som VibeiDE kjører dem. Ingen verktøy, ingen nettilgang, ingen nye forsøk og ingen utvelgelse av det beste av N svar.
- Modellene kjøres etter hverandre, aldri parallelt. Et svar som ikke kommer innen 40 minutter, får 0 poeng.
- Poengberegningen utføres av et deterministisk program. Ingen modell vurderer en annen modell.
Les hele oppgaven (ren tekst, 7,691 tegn). Modellnavnene er aliasene som hvert kommandolinjeverktøy tilbyr. Siden registrerer modellidentifikatoren som verktøyet rapporterte.
Spørsmål
Blir Claude eller GPT svekket?
Denne siden kan ikke se hva som skjer internt hos en leverandør, men den viser om det samme modellnavnet får ulike poengsummer på den samme uendrede oppgaven over tid. Én kjøring per uke er én enkelt observasjon, så betrakt en endring på noen få poeng som støy og en nedgang som varer i flere uker som et signal.
Hvorfor klarer ingen modell å nå 100?
Målfiguren består av kuler, ellipsoider, sylindre og skråstilte kapsler, mens svaret bare kan bruke 150 aksejusterte bokser. Bokser kan ikke følge kurver nøyaktig, så alle svar mangler noe volum. Bedre modeller bruker boksene der kurvene er, og skulpturene deres ligner mer på målfiguren.
Hvordan kjøres modellene?
Hver modell får oppgaven én gang gjennom sitt offisielle kommandolinjeverktøy, Claude Code eller Codex, innlogget med et vanlig abonnement og med middels resonneringsnivå. Verktøy, underagenter, nettilgang og nye forsøk er deaktivert. En kjøring som bruker et verktøy, får 0 poeng. Svaret poengsettes av et deterministisk program, ikke av en annen modell.
Hvorfor ble testen endret til v3?
De to første versjonene ba modellene om å utforme et kontor. I de første rundene fikk de beste modellene 100 og 92 poeng, og alle korrekte kontorer så like ut. En test der toppmodellene oppnår maksimal poengsum, kan ikke vise utvikling, og en test der svarene ser like ut, kan ikke vise kvalitet. Derfor ber v3 om en skulptur der kvaliteten er synlig ved første øyekast.
Kan jeg prøve oppgaven selv?
Ja. Hele oppgaven er offentlig tilgjengelig som ren tekst. Lim den inn i en hvilken som helst modell, og sammenlign svaret med målfiguren.