Kontorbenchmark

Hvilken KI bygger best?

Seks modeller. Én oppgavebeskrivelse. Ett forsøk hver. Poeng fra 0 til 100 basert på samsvar med den nøyaktige målfiguren.

Resultatliste.

Hva hver modell bygde.

Ubehandlet resultat, visualisert fra JSON-dataene hver modell returnerte. Ett forsøk, ingen nye forsøk.

Uke 2026-W41

Alle skulpturene bruker samme belysning, kamera og målestokk. Velg et resultat for å sammenligne det med målet, eller bytt til Forskjell for å undersøke avvikene.

  1. Claude Opus 5.578.5/100Skulptur laget av Claude Opus 5.5
  2. GPT-6.1 Sol74.7/100Skulptur laget av GPT-6.1 Sol
  3. Claude Fable74.6/100Skulptur laget av Claude Fable
  4. GPT-6 Astra73.5/100Skulptur laget av GPT-6 Astra
  5. Claude Sonnet 5.548.1/100Skulptur laget av Claude Sonnet 5.5
  6. GPT-6 Luna30.9/100Skulptur laget av GPT-6 Luna

Kvalitet, tokener og tid

Hva krevde hvert resultat?

Sammenlign poengsum, rapportert sum av inn- og utdatatokener og medgått kjøretid for den valgte runden. Resonneringstokener legges ikke til på nytt. Manglende målinger utelates og regnes ikke som null.

Se målinger av tokenbruk og kjøretid

Målte resultater

Runde for runde.

Den opprinnelige referansen bevarer resultatene og måledatoene fra første runde. Neste punkt er en ny målt runde, ikke et resultat fra en annen uke.

Se de registrerte poengsummene
Poengsum av 100 per runde
RundeClaude Opus 5 / Claude Opus 5.5Claude Sonnet 5 / Claude Sonnet 5.5Claude FableGPT-6.1 SolGPT-6 AstraGPT-6 Luna
2026-W4178.5 (Claude Opus 5.5)48.1 (Claude Sonnet 5.5)74.6 (Claude Fable)74.7 (GPT-6.1 Sol)73.5 (GPT-6 Astra)30.9 (GPT-6 Luna)
Opprinnelig referanse75.5 (Claude Opus 5)34.3 (Claude Sonnet 5)71.2 (Claude Fable)70.6 (GPT-6.1 Sol)77.5 (GPT-6 Astra)45.6 (GPT-6 Luna)

Om benchmarken

Gi en KI 150 bokser. Be om dette.

Et rundt hode. En buet stol. En liten skrivebordslampe. Hvor nær kan en språkmodell komme med bare rektangulære klosser?

Målet: en hvit robot på en grønn stol ved et rundt skrivebord med skjerm, lampe, krus og plante
Skulpturen som skal gjenskapes. 56 former.
klosser maksimalt
150
modeller
6
forsøk per runde
1

Slik fungerer det.

En fast oppgavebeskrivelse.

Alle modellene får den samme skriftlige oppgavebeskrivelsen med målfigurens dimensjoner og farger. Hele oppgavebeskrivelsen er offentlig.

Kun JSON.

Svaret inneholder ingenting annet: opptil 150 bokser med posisjoner, størrelser og farger.

Ett forsøk.

Middels resonneringsinnsats, ingen verktøy, ingen nye forsøk. Tokenbruk og kjøretid registreres.

En fast poengberegning.

Volumoverlapp med målfiguren, vektet etter hvor riktige fargene er, fra 0 til 100.

Formelen

volumoverlapp i % × andel kuber med riktig farge

Målt i enheter på 1 cm³. Oppgavebeskrivelsens fingeravtrykk 08fb5a5773fe89e7. Utgangspunktet bevarer de opprinnelige resultatene fra første runde.

Fullstendig metodikk og spørsmål

Slik fungerer det

Oppgavebeskrivelsen oppgir alle formene i referansefiguren med nøyaktige tall. Hver modell svarer kun med JSON: opptil 150 bokser, hver med en posisjon, en størrelse og én av 11 farger. Modellen tegner ingenting selv. Når en kjøring poengsettes, gjengir vi boksene og referansefiguren med de samme små kubene, samme belysning og samme kamera, og publiserer bildene.

Poengsummen beregnes som volumoverlappet mellom skulpturen og målfiguren (snitt delt på union, målt i kuber på 1 cm), multiplisert med andelen overlappende kuber som har riktig farge. Én boks per form gir under 40 poeng. Å dele hver form i like tykke skiver gir omtrent 50 poeng. Skråstilte ben, tynne kabler og runde hoder belønner modeller som planlegger plasseringen av hver boks, og visningen Forskjell viser hver kube som mangler, er overflødig eller har feil farge.

Rettferdig og repeterbart

Den opprinnelige referansen er den første runden, bevart med de faktiske måledatoene. En ny målt runde ble etterspurt til lanseringen. Begge vises; ingen av dem er tilbakedatert eller valgt ut som det beste av to resultater. Senere runder følger den ukentlige planen.

  • Samme oppgave, samme poengberegningsprogram og samme innstillinger hver uke. Oppgave v3 har fingeravtrykket 08fb5a5773fe89e7. Enhver endring starter en ny versjon og et nytt diagram.
  • Hver modell svarer én gang med middels resonneringsinnsats, gjennom Claude Code eller Codex innlogget med et abonnement, på samme måte som VibeiDE kjører dem. Ingen verktøy, ingen nettilgang, ingen nye forsøk og ingen utvelgelse av det beste av N svar.
  • Modellene kjøres etter hverandre, aldri parallelt. Et svar som ikke kommer innen 40 minutter, får 0 poeng.
  • Poengberegningen utføres av et deterministisk program. Ingen modell vurderer en annen modell.

Les hele oppgaven (ren tekst, 7,691 tegn). Modellnavnene er aliasene som hvert kommandolinjeverktøy tilbyr. Siden registrerer modellidentifikatoren som verktøyet rapporterte.

Spørsmål

Blir Claude eller GPT svekket?

Denne siden kan ikke se hva som skjer internt hos en leverandør, men den viser om det samme modellnavnet får ulike poengsummer på den samme uendrede oppgaven over tid. Én kjøring per uke er én enkelt observasjon, så betrakt en endring på noen få poeng som støy og en nedgang som varer i flere uker som et signal.

Hvorfor klarer ingen modell å nå 100?

Målfiguren består av kuler, ellipsoider, sylindre og skråstilte kapsler, mens svaret bare kan bruke 150 aksejusterte bokser. Bokser kan ikke følge kurver nøyaktig, så alle svar mangler noe volum. Bedre modeller bruker boksene der kurvene er, og skulpturene deres ligner mer på målfiguren.

Hvordan kjøres modellene?

Hver modell får oppgaven én gang gjennom sitt offisielle kommandolinjeverktøy, Claude Code eller Codex, innlogget med et vanlig abonnement og med middels resonneringsnivå. Verktøy, underagenter, nettilgang og nye forsøk er deaktivert. En kjøring som bruker et verktøy, får 0 poeng. Svaret poengsettes av et deterministisk program, ikke av en annen modell.

Hvorfor ble testen endret til v3?

De to første versjonene ba modellene om å utforme et kontor. I de første rundene fikk de beste modellene 100 og 92 poeng, og alle korrekte kontorer så like ut. En test der toppmodellene oppnår maksimal poengsum, kan ikke vise utvikling, og en test der svarene ser like ut, kan ikke vise kvalitet. Derfor ber v3 om en skulptur der kvaliteten er synlig ved første øyekast.

Kan jeg prøve oppgaven selv?

Ja. Hele oppgaven er offentlig tilgjengelig som ren tekst. Lim den inn i en hvilken som helst modell, og sammenlign svaret med målfiguren.

Språk

Necessary cookies support sign-in, security, your language and this choice. Optional categories stay off until accepted.

First-party page views and acquisition measurement, plus Google Analytics 4 (Google Ireland, data may reach the US). Advertising personalization stays off.

With Analytics enabled, retain Google and Microsoft ad click identifiers and share download, signup, activation and purchase conversions with the relevant ad provider. No personalized advertising.

Remember referral credit for later. Links still work on the current page without this cookie.

Privacy · Cookie inventory