Office-Benchmark
Welche KI baut am besten?
Sechs Modelle. Eine Aufgabenbeschreibung. Je ein Versuch. Bewertet von 0 bis 100 anhand der exakten Zielvorgabe.
Rangliste.
Was jedes Modell gebaut hat.
Unveränderte Ausgabe, gerendert aus dem JSON, das jedes Modell zurückgegeben hat. Ein Versuch, keine Wiederholungen.
Alle Skulpturen werden mit derselben Beleuchtung, Kamera und im selben Maßstab gezeigt. Wähle ein Ergebnis aus, um es mit der Vorlage zu vergleichen, oder wechsle zur Differenzansicht, um die Abweichungen genauer zu betrachten.
Hinweise
Qualität, Tokens und Zeit
Welchen Aufwand erforderte jedes Ergebnis?
Vergleiche für die ausgewählte Runde die Punktzahl, die gemeldete Summe der Eingabe- und Ausgabetokens sowie die verstrichene Laufzeit. Reasoning-Tokens werden nicht erneut addiert. Fehlende Messwerte werden ausgelassen und nicht als null gewertet.
Token- und Laufzeitmessungen ansehen
Gemessene Ergebnisse
Runde für Runde.
Die Ausgangsbasis bewahrt die ursprünglichen Ergebnisse der ersten Runde samt Messdaten. Der nächste Datenpunkt stammt aus einer neu gemessenen Runde und ist kein Ergebnis aus einer anderen Woche.
Erfasste Punktzahlen ansehen
| Runde | Claude Opus 5 / Claude Opus 5.5 | Claude Sonnet 5 / Claude Sonnet 5.5 | Claude Fable | GPT-6.1 Sol | GPT-6 Astra | GPT-6 Luna |
|---|---|---|---|---|---|---|
| 2026-W41 | 78.5 (Claude Opus 5.5) | 48.1 (Claude Sonnet 5.5) | 74.6 (Claude Fable) | 74.7 (GPT-6.1 Sol) | 73.5 (GPT-6 Astra) | 30.9 (GPT-6 Luna) |
| Ausgangsbasis | 75.5 (Claude Opus 5) | 34.3 (Claude Sonnet 5) | 71.2 (Claude Fable) | 70.6 (GPT-6.1 Sol) | 77.5 (GPT-6 Astra) | 45.6 (GPT-6 Luna) |
Über den Benchmark
Gib einer KI 150 Quader. Lass sie das hier bauen.
Ein runder Kopf. Ein geschwungener Stuhl. Eine winzige Schreibtischlampe. Wie nah kommt ein Sprachmodell der Vorlage, wenn es nur Quader verwenden darf?
- Quader maximal
- 150
- Modelle
- 6
- Versuch pro Runde
- 1
So funktioniert’s.
Eine festgelegte Aufgabenbeschreibung.
Jedes Modell erhält dieselbe schriftliche Aufgabenbeschreibung mit den vorgegebenen Abmessungen und Farben. Die vollständige Aufgabenbeschreibung ist öffentlich.
Nur JSON.
Die Antwort enthält nichts anderes: bis zu 150 Quader mit Positionen, Größen und Farben.
Ein Versuch.
Mittlerer Denkaufwand, keine Tools, keine Wiederholungsversuche. Tokenverbrauch und Laufzeit werden erfasst.
Ein festgelegtes Bewertungsverfahren.
Volumenüberschneidung mit der Zielvorgabe, gewichtet nach Farbgenauigkeit, auf einer Skala von 0 bis 100.
Die Formel
Volumenüberschneidung in % × Anteil korrekt eingefärbter WürfelGemessen in Einheiten von 1 cm³. Fingerabdruck der Aufgabenbeschreibung: 08fb5a5773fe89e7. Die Ausgangsbasis bewahrt die ursprünglichen Ergebnisse der ersten Runde.
Vollständige Methodik und Fragen
So funktioniert es
Die Aufgabenbeschreibung führt jede Form der Vorlage mit exakten Zahlen auf. Jedes Modell antwortet ausschließlich mit JSON: bis zu 150 Quader, jeweils mit einer Position, einer Größe und einer von 11 Farben. Das Modell zeichnet selbst nichts. Wenn ein Durchlauf bewertet wird, rendern wir seine Quader und die Vorlage aus denselben kleinen Würfeln, mit derselben Beleuchtung und Kamera, und veröffentlichen die Bilder.
Die Punktzahl ergibt sich aus der Volumenüberlappung zwischen Skulptur und Vorlage (Schnittmenge geteilt durch Vereinigungsmenge, gemessen in 1 cm großen Würfeln), multipliziert mit dem Anteil der überlappenden Würfel, die die richtige Farbe haben. Ein Quader pro Form ergibt weniger als 40 Punkte; wird jede Form in gleich große Scheiben zerlegt, sind es etwa 50 Punkte. Schräge Beine, dünne Kabel und runde Köpfe belohnen Modelle, die die Platzierung jedes Quaders planen. Die Ansicht „Unterschied“ zeigt jeden fehlenden, zusätzlichen und falsch eingefärbten Würfel.
Fair und wiederholbar
Die Ausgangsbasis ist die ursprüngliche erste Runde, deren tatsächliche Messdaten erhalten bleiben. Für den Launch wurde eine zweite gemessene Runde angefordert. Beide werden angezeigt; keine wird rückdatiert oder als bestes Ergebnis aus zwei Runden ausgewählt. Spätere Runden folgen dem wöchentlichen Zeitplan.
- Jede Woche dieselbe Aufgabenbeschreibung, dasselbe Bewertungsprogramm und dieselben Einstellungen. Die Aufgabenbeschreibung v3 hat den Fingerabdruck
08fb5a5773fe89e7; jede Änderung beginnt eine neue Version mit einem neuen Diagramm. - Jedes Modell antwortet einmal mit mittlerem Denkaufwand über Claude Code oder Codex, mit einem Abo angemeldet, genauso wie VibeiDE die Modelle ausführt. Keine Tools, kein Webzugriff, keine Wiederholungsversuche, keine Auswahl der besten von N Antworten.
- Die Modelle laufen nacheinander, nie parallel. Eine Antwort, die nicht innerhalb von 40 Minuten eintrifft, erhält 0 Punkte.
- Das Bewertungsprogramm ist deterministisch. Kein Modell bewertet ein anderes Modell.
Lies die vollständige Aufgabenbeschreibung (Klartext, 7,691 Zeichen). Die Modellnamen sind die Aliasnamen, die die jeweilige CLI anbietet; die Seite erfasst die von der CLI gemeldete Modellkennung.
Fragen
Werden Claude oder GPT schlechter gemacht?
Diese Seite kann nicht hinter die Kulissen eines Anbieters schauen. Sie zeigt aber, ob dasselbe Modell unter demselben Namen bei derselben unveränderten Aufgabe im Laufe der Zeit anders abschneidet. Ein Durchlauf pro Woche ist nur eine einzelne Stichprobe. Betrachte eine Veränderung um wenige Punkte deshalb als Rauschen und einen Rückgang über mehrere Wochen als Signal.
Warum erreicht kein Modell 100 Punkte?
Die Vorlage besteht aus Kugeln, Ellipsoiden, Zylindern und schrägen Kapselformen, während die Antwort nur 150 achsenparallele Quader verwenden darf. Quader können Rundungen nicht exakt nachbilden, deshalb geht bei jeder Antwort etwas Volumen verloren. Bessere Modelle setzen ihre Quader gezielt an den Rundungen ein, sodass ihre Skulpturen der Vorlage stärker ähneln.
Wie werden die Modelle ausgeführt?
Jedes Modell erhält die Aufgabenbeschreibung einmal über sein offizielles Kommandozeilenwerkzeug, Claude Code oder Codex, angemeldet mit einem regulären Abonnement und mit mittlerem Denkaufwand. Werkzeuge, Unteragenten, Webzugriff und Wiederholungsversuche sind deaktiviert; ein Durchlauf, der ein Werkzeug verwendet, erhält 0 Punkte. Die Antwort wird von einem deterministischen Programm bewertet, nicht von einem anderen Modell.
Warum wurde der Benchmark auf v3 umgestellt?
In den ersten beiden Versionen sollten die Modelle ein Büro einrichten. In den ersten Runden erreichten die besten Modelle 100 und 92 Punkte, und jedes korrekt eingerichtete Büro sah gleich aus. Ein Benchmark, bei dem Spitzenmodelle die Höchstpunktzahl erreichen, kann keine Veränderungen sichtbar machen. Wenn alle Antworten gleich aussehen, lässt sich auch die Qualität nicht erkennen. Deshalb verlangt v3 eine Skulptur, deren Qualität auf einen Blick sichtbar ist.
Kann ich die Aufgabe selbst ausprobieren?
Ja. Die vollständige Aufgabenbeschreibung ist als Klartext öffentlich zugänglich. Füge sie in ein beliebiges Modell ein und vergleiche seine Antwort mit der Vorlage.