Kantoorbenchmark
Welke AI bouwt het best?
Zes modellen. Eén opdracht. Elk één poging. Een score van 0 tot 100 op basis van het exacte doelontwerp.
Ranglijst.
Wat elk model bouwde.
Ruwe uitvoer, weergegeven op basis van de JSON die elk model teruggaf. Eén poging, geen herkansingen.
Elk beeld gebruikt dezelfde belichting, camera en schaal. Selecteer een resultaat om het met het voorbeeld te vergelijken, of schakel over naar Verschil om de afwijkingen te bekijken.
Opmerkingen
Kwaliteit, tokens en tijd
Wat was er nodig voor elk resultaat?
Vergelijk de score, het gerapporteerde totaal van invoer- en uitvoertokens en de verstreken uitvoeringstijd voor de geselecteerde ronde. Redeneertokens worden niet nogmaals opgeteld. Ontbrekende metingen worden weggelaten en tellen niet mee als nul.
Bekijk de metingen van tokengebruik en uitvoeringstijd
Gemeten resultaten
Ronde na ronde.
De nulmeting behoudt de oorspronkelijke resultaten en meetdatums van de eerste ronde. Het volgende punt is een nieuwe gemeten ronde, geen resultaat uit een andere week.
Bekijk de vastgelegde scores
| Ronde | Claude Opus 5 / Claude Opus 5.5 | Claude Sonnet 5 / Claude Sonnet 5.5 | Claude Fable | GPT-6.1 Sol | GPT-6 Astra | GPT-6 Luna |
|---|---|---|---|---|---|---|
| 2026-W41 | 78.5 (Claude Opus 5.5) | 48.1 (Claude Sonnet 5.5) | 74.6 (Claude Fable) | 74.7 (GPT-6.1 Sol) | 73.5 (GPT-6 Astra) | 30.9 (GPT-6 Luna) |
| Nulmeting | 75.5 (Claude Opus 5) | 34.3 (Claude Sonnet 5) | 71.2 (Claude Fable) | 70.6 (GPT-6.1 Sol) | 77.5 (GPT-6 Astra) | 45.6 (GPT-6 Luna) |
Over de benchmark
Geef een AI 150 blokken. Vraag om dit.
Een rond hoofd. Een gebogen stoel. Een kleine bureaulamp. Hoe dicht kan een taalmodel in de buurt komen met alleen rechthoekige blokken?
- blokken maximaal
- 150
- modellen
- 6
- poging per ronde
- 1
Hoe het werkt.
Een vastgelegde opdracht.
Elk model krijgt dezelfde schriftelijke opdracht met de beoogde afmetingen en kleuren. De volledige opdracht is openbaar.
Alleen JSON.
Het antwoord bevat niets anders: maximaal 150 blokken met posities, afmetingen en kleuren.
Eén poging.
Gemiddelde redeneerinspanning, geen tools, geen herkansingen. Het aantal tokens en de uitvoeringstijd worden bijgehouden.
Een vastgelegd scoresysteem.
Volumeoverlap met het doelontwerp, gewogen naar kleurnauwkeurigheid, van 0 tot 100.
De formule
volumeoverlap % × aandeel kubussen met de juiste kleurGemeten in eenheden van 1 cm³. Vingerafdruk van de opdracht 08fb5a5773fe89e7. De oorspronkelijke resultaten van de eerste ronde blijven behouden als uitgangsmeting.
Volledige methodologie en vragen
Hoe het werkt
De opdracht beschrijft elke vorm van het voorbeeld met exacte getallen. Elk model antwoordt uitsluitend met JSON: maximaal 150 blokken, elk met een positie, afmetingen en een van 11 kleuren. Het model tekent zelf niets. Wanneer we een inzending beoordelen, renderen we de blokken en het voorbeeld met dezelfde kleine kubussen, dezelfde belichting en dezelfde camera, en publiceren we de beelden.
De score is de volumeoverlap tussen de sculptuur en het voorbeeld (doorsnede gedeeld door vereniging, gemeten in kubussen van 1 cm), vermenigvuldigd met het aandeel overlappende kubussen met de juiste kleur. Eén blok per vorm levert een score onder 40 op; elke vorm in gelijke plakken verdelen levert ongeveer 50 op. Schuine poten, dunne kabels en ronde hoofden belonen modellen die plannen waar elk blok moet komen. De weergave Verschil toont elke ontbrekende, extra en verkeerd gekleurde kubus.
Eerlijk en herhaalbaar
De nulmeting is de oorspronkelijke eerste ronde, bewaard met de werkelijke meetdatums. Voor de lancering is een tweede gemeten ronde aangevraagd. Beide worden getoond; geen van beide is van een eerdere datum voorzien of gekozen als het beste resultaat van de twee. Latere rondes volgen het wekelijkse schema.
- Elke week dezelfde opdracht, hetzelfde beoordelingsprogramma en dezelfde instellingen. Opdracht v3 heeft de vingerafdruk
08fb5a5773fe89e7; bij elke wijziging beginnen een nieuwe versie en een nieuwe grafiek. - Elk model antwoordt één keer met een gemiddelde redeneerinspanning, via Claude Code of Codex, aangemeld met een abonnement, op dezelfde manier waarop VibeiDE ze uitvoert. Geen tools, geen webtoegang, geen nieuwe pogingen en geen selectie van het beste resultaat uit N pogingen.
- Modellen worden na elkaar uitgevoerd, nooit parallel. Een antwoord dat niet binnen 40 minuten binnenkomt, scoort 0.
- Het beoordelingsprogramma is deterministisch. Geen enkel model beoordeelt een ander model.
Lees de volledige opdracht (platte tekst, 7,691 tekens). De modelnamen zijn de aliassen die elke CLI aanbiedt; de pagina legt de modelidentificatie vast die de CLI heeft gerapporteerd.
Vragen
Worden Claude of GPT minder krachtig gemaakt?
Deze pagina kan niet bij een aanbieder achter de schermen kijken, maar laat wel zien of dezelfde modelnaam door de tijd heen anders scoort op dezelfde vastgelegde opdracht. Eén uitvoering per week is één steekproef, dus beschouw een verschil van een paar punten als ruis en een daling die meerdere weken aanhoudt als een signaal.
Waarom haalt geen enkel model 100?
Het voorbeeld bestaat uit bollen, ellipsoïden, cilinders en schuine capsules, terwijl het antwoord uitsluitend uit maximaal 150 blokken mag bestaan die langs de coördinaatassen zijn uitgelijnd. Blokken kunnen rondingen niet exact volgen, waardoor elk antwoord wat volume mist. Betere modellen gebruiken hun blokken waar de rondingen zitten, waardoor hun sculpturen meer op het voorbeeld lijken.
Hoe worden de modellen uitgevoerd?
Elk model krijgt de opdracht één keer via zijn officiële opdrachtregeltool, Claude Code of Codex, aangemeld met een regulier abonnement en met een gemiddelde redeneerinspanning. Tools, subagents, webtoegang en nieuwe pogingen zijn uitgeschakeld; een uitvoering die een tool gebruikt, krijgt een score van 0. Een deterministisch programma beoordeelt het antwoord, geen ander model.
Waarom is de benchmark overgestapt op v3?
In de eerste twee versies moesten modellen een kantoor inrichten. In de eerste rondes scoorden de beste modellen 100 en 92, en elk correct kantoor zag er hetzelfde uit. Een benchmark waarop de beste modellen de maximale score halen, kan geen verandering laten zien. En als alle antwoorden op elkaar lijken, wordt de kwaliteit niet zichtbaar. Daarom vraagt v3 om een sculptuur waarvan je de kwaliteit in één oogopslag kunt zien.
Kan ik de opdracht zelf proberen?
Ja. De volledige opdracht is openbaar beschikbaar als platte tekst. Plak die in een willekeurig model en vergelijk het antwoord met het voorbeeld.