Kantoorbenchmark

Welke AI bouwt het best?

Zes modellen. Eén opdracht. Elk één poging. Een score van 0 tot 100 op basis van het exacte doelontwerp.

Ranglijst.

Wat elk model bouwde.

Ruwe uitvoer, weergegeven op basis van de JSON die elk model teruggaf. Eén poging, geen herkansingen.

Week 2026-W41

Elk beeld gebruikt dezelfde belichting, camera en schaal. Selecteer een resultaat om het met het voorbeeld te vergelijken, of schakel over naar Verschil om de afwijkingen te bekijken.

  1. Claude Opus 5.578.5/100Sculptuur van Claude Opus 5.5
  2. GPT-6.1 Sol74.7/100Sculptuur van GPT-6.1 Sol
  3. Claude Fable74.6/100Sculptuur van Claude Fable
  4. GPT-6 Astra73.5/100Sculptuur van GPT-6 Astra
  5. Claude Sonnet 5.548.1/100Sculptuur van Claude Sonnet 5.5
  6. GPT-6 Luna30.9/100Sculptuur van GPT-6 Luna

Kwaliteit, tokens en tijd

Wat was er nodig voor elk resultaat?

Vergelijk de score, het gerapporteerde totaal van invoer- en uitvoertokens en de verstreken uitvoeringstijd voor de geselecteerde ronde. Redeneertokens worden niet nogmaals opgeteld. Ontbrekende metingen worden weggelaten en tellen niet mee als nul.

Bekijk de metingen van tokengebruik en uitvoeringstijd

Gemeten resultaten

Ronde na ronde.

De nulmeting behoudt de oorspronkelijke resultaten en meetdatums van de eerste ronde. Het volgende punt is een nieuwe gemeten ronde, geen resultaat uit een andere week.

Bekijk de vastgelegde scores
Score op een schaal van 100 per ronde
RondeClaude Opus 5 / Claude Opus 5.5Claude Sonnet 5 / Claude Sonnet 5.5Claude FableGPT-6.1 SolGPT-6 AstraGPT-6 Luna
2026-W4178.5 (Claude Opus 5.5)48.1 (Claude Sonnet 5.5)74.6 (Claude Fable)74.7 (GPT-6.1 Sol)73.5 (GPT-6 Astra)30.9 (GPT-6 Luna)
Nulmeting75.5 (Claude Opus 5)34.3 (Claude Sonnet 5)71.2 (Claude Fable)70.6 (GPT-6.1 Sol)77.5 (GPT-6 Astra)45.6 (GPT-6 Luna)

Over de benchmark

Geef een AI 150 blokken. Vraag om dit.

Een rond hoofd. Een gebogen stoel. Een kleine bureaulamp. Hoe dicht kan een taalmodel in de buurt komen met alleen rechthoekige blokken?

Het voorbeeld: een witte robot op een groene stoel aan een rond bureau met een monitor, lamp, mok en plant
Het na te bouwen beeldhouwwerk. 56 vormen.
blokken maximaal
150
modellen
6
poging per ronde
1

Hoe het werkt.

Een vastgelegde opdracht.

Elk model krijgt dezelfde schriftelijke opdracht met de beoogde afmetingen en kleuren. De volledige opdracht is openbaar.

Alleen JSON.

Het antwoord bevat niets anders: maximaal 150 blokken met posities, afmetingen en kleuren.

Eén poging.

Gemiddelde redeneerinspanning, geen tools, geen herkansingen. Het aantal tokens en de uitvoeringstijd worden bijgehouden.

Een vastgelegd scoresysteem.

Volumeoverlap met het doelontwerp, gewogen naar kleurnauwkeurigheid, van 0 tot 100.

De formule

volumeoverlap % × aandeel kubussen met de juiste kleur

Gemeten in eenheden van 1 cm³. Vingerafdruk van de opdracht 08fb5a5773fe89e7. De oorspronkelijke resultaten van de eerste ronde blijven behouden als uitgangsmeting.

Volledige methodologie en vragen

Hoe het werkt

De opdracht beschrijft elke vorm van het voorbeeld met exacte getallen. Elk model antwoordt uitsluitend met JSON: maximaal 150 blokken, elk met een positie, afmetingen en een van 11 kleuren. Het model tekent zelf niets. Wanneer we een inzending beoordelen, renderen we de blokken en het voorbeeld met dezelfde kleine kubussen, dezelfde belichting en dezelfde camera, en publiceren we de beelden.

De score is de volumeoverlap tussen de sculptuur en het voorbeeld (doorsnede gedeeld door vereniging, gemeten in kubussen van 1 cm), vermenigvuldigd met het aandeel overlappende kubussen met de juiste kleur. Eén blok per vorm levert een score onder 40 op; elke vorm in gelijke plakken verdelen levert ongeveer 50 op. Schuine poten, dunne kabels en ronde hoofden belonen modellen die plannen waar elk blok moet komen. De weergave Verschil toont elke ontbrekende, extra en verkeerd gekleurde kubus.

Eerlijk en herhaalbaar

De nulmeting is de oorspronkelijke eerste ronde, bewaard met de werkelijke meetdatums. Voor de lancering is een tweede gemeten ronde aangevraagd. Beide worden getoond; geen van beide is van een eerdere datum voorzien of gekozen als het beste resultaat van de twee. Latere rondes volgen het wekelijkse schema.

  • Elke week dezelfde opdracht, hetzelfde beoordelingsprogramma en dezelfde instellingen. Opdracht v3 heeft de vingerafdruk 08fb5a5773fe89e7; bij elke wijziging beginnen een nieuwe versie en een nieuwe grafiek.
  • Elk model antwoordt één keer met een gemiddelde redeneerinspanning, via Claude Code of Codex, aangemeld met een abonnement, op dezelfde manier waarop VibeiDE ze uitvoert. Geen tools, geen webtoegang, geen nieuwe pogingen en geen selectie van het beste resultaat uit N pogingen.
  • Modellen worden na elkaar uitgevoerd, nooit parallel. Een antwoord dat niet binnen 40 minuten binnenkomt, scoort 0.
  • Het beoordelingsprogramma is deterministisch. Geen enkel model beoordeelt een ander model.

Lees de volledige opdracht (platte tekst, 7,691 tekens). De modelnamen zijn de aliassen die elke CLI aanbiedt; de pagina legt de modelidentificatie vast die de CLI heeft gerapporteerd.

Vragen

Worden Claude of GPT minder krachtig gemaakt?

Deze pagina kan niet bij een aanbieder achter de schermen kijken, maar laat wel zien of dezelfde modelnaam door de tijd heen anders scoort op dezelfde vastgelegde opdracht. Eén uitvoering per week is één steekproef, dus beschouw een verschil van een paar punten als ruis en een daling die meerdere weken aanhoudt als een signaal.

Waarom haalt geen enkel model 100?

Het voorbeeld bestaat uit bollen, ellipsoïden, cilinders en schuine capsules, terwijl het antwoord uitsluitend uit maximaal 150 blokken mag bestaan die langs de coördinaatassen zijn uitgelijnd. Blokken kunnen rondingen niet exact volgen, waardoor elk antwoord wat volume mist. Betere modellen gebruiken hun blokken waar de rondingen zitten, waardoor hun sculpturen meer op het voorbeeld lijken.

Hoe worden de modellen uitgevoerd?

Elk model krijgt de opdracht één keer via zijn officiële opdrachtregeltool, Claude Code of Codex, aangemeld met een regulier abonnement en met een gemiddelde redeneerinspanning. Tools, subagents, webtoegang en nieuwe pogingen zijn uitgeschakeld; een uitvoering die een tool gebruikt, krijgt een score van 0. Een deterministisch programma beoordeelt het antwoord, geen ander model.

Waarom is de benchmark overgestapt op v3?

In de eerste twee versies moesten modellen een kantoor inrichten. In de eerste rondes scoorden de beste modellen 100 en 92, en elk correct kantoor zag er hetzelfde uit. Een benchmark waarop de beste modellen de maximale score halen, kan geen verandering laten zien. En als alle antwoorden op elkaar lijken, wordt de kwaliteit niet zichtbaar. Daarom vraagt v3 om een sculptuur waarvan je de kwaliteit in één oogopslag kunt zien.

Kan ik de opdracht zelf proberen?

Ja. De volledige opdracht is openbaar beschikbaar als platte tekst. Plak die in een willekeurig model en vergelijk het antwoord met het voorbeeld.

Talen

Necessary cookies support sign-in, security, your language and this choice. Optional categories stay off until accepted.

First-party page views and acquisition measurement, plus Google Analytics 4 (Google Ireland, data may reach the US). Advertising personalization stays off.

With Analytics enabled, retain Google and Microsoft ad click identifiers and share download, signup, activation and purchase conversions with the relevant ad provider. No personalized advertising.

Remember referral credit for later. Links still work on the current page without this cookie.

Privacy · Cookie inventory