Office-Benchmark

Welche KI baut am besten?

Sechs Modelle. Eine Aufgabenbeschreibung. Je ein Versuch. Bewertet von 0 bis 100 anhand der exakten Zielvorgabe.

Rangliste.

Was jedes Modell gebaut hat.

Unveränderte Ausgabe, gerendert aus dem JSON, das jedes Modell zurückgegeben hat. Ein Versuch, keine Wiederholungen.

Woche 2026-W41

Alle Skulpturen werden mit derselben Beleuchtung, Kamera und im selben Maßstab gezeigt. Wähle ein Ergebnis aus, um es mit der Vorlage zu vergleichen, oder wechsle zur Differenzansicht, um die Abweichungen genauer zu betrachten.

  1. Claude Opus 5.578.5/100Skulptur von Claude Opus 5.5
  2. GPT-6.1 Sol74.7/100Skulptur von GPT-6.1 Sol
  3. Claude Fable74.6/100Skulptur von Claude Fable
  4. GPT-6 Astra73.5/100Skulptur von GPT-6 Astra
  5. Claude Sonnet 5.548.1/100Skulptur von Claude Sonnet 5.5
  6. GPT-6 Luna30.9/100Skulptur von GPT-6 Luna

Qualität, Tokens und Zeit

Welchen Aufwand erforderte jedes Ergebnis?

Vergleiche für die ausgewählte Runde die Punktzahl, die gemeldete Summe der Eingabe- und Ausgabetokens sowie die verstrichene Laufzeit. Reasoning-Tokens werden nicht erneut addiert. Fehlende Messwerte werden ausgelassen und nicht als null gewertet.

Token- und Laufzeitmessungen ansehen

Gemessene Ergebnisse

Runde für Runde.

Die Ausgangsbasis bewahrt die ursprünglichen Ergebnisse der ersten Runde samt Messdaten. Der nächste Datenpunkt stammt aus einer neu gemessenen Runde und ist kein Ergebnis aus einer anderen Woche.

Erfasste Punktzahlen ansehen
Punktzahl von 100 pro Runde
RundeClaude Opus 5 / Claude Opus 5.5Claude Sonnet 5 / Claude Sonnet 5.5Claude FableGPT-6.1 SolGPT-6 AstraGPT-6 Luna
2026-W4178.5 (Claude Opus 5.5)48.1 (Claude Sonnet 5.5)74.6 (Claude Fable)74.7 (GPT-6.1 Sol)73.5 (GPT-6 Astra)30.9 (GPT-6 Luna)
Ausgangsbasis75.5 (Claude Opus 5)34.3 (Claude Sonnet 5)71.2 (Claude Fable)70.6 (GPT-6.1 Sol)77.5 (GPT-6 Astra)45.6 (GPT-6 Luna)

Über den Benchmark

Gib einer KI 150 Quader. Lass sie das hier bauen.

Ein runder Kopf. Ein geschwungener Stuhl. Eine winzige Schreibtischlampe. Wie nah kommt ein Sprachmodell der Vorlage, wenn es nur Quader verwenden darf?

Die Vorlage: ein weißer Roboter auf einem grünen Stuhl an einem runden Schreibtisch mit Monitor, Lampe, Tasse und Pflanze
Die nachzubauende Skulptur. 56 Formen.
Quader maximal
150
Modelle
6
Versuch pro Runde
1

So funktioniert’s.

Eine festgelegte Aufgabenbeschreibung.

Jedes Modell erhält dieselbe schriftliche Aufgabenbeschreibung mit den vorgegebenen Abmessungen und Farben. Die vollständige Aufgabenbeschreibung ist öffentlich.

Nur JSON.

Die Antwort enthält nichts anderes: bis zu 150 Quader mit Positionen, Größen und Farben.

Ein Versuch.

Mittlerer Denkaufwand, keine Tools, keine Wiederholungsversuche. Tokenverbrauch und Laufzeit werden erfasst.

Ein festgelegtes Bewertungsverfahren.

Volumenüberschneidung mit der Zielvorgabe, gewichtet nach Farbgenauigkeit, auf einer Skala von 0 bis 100.

Die Formel

Volumenüberschneidung in % × Anteil korrekt eingefärbter Würfel

Gemessen in Einheiten von 1 cm³. Fingerabdruck der Aufgabenbeschreibung: 08fb5a5773fe89e7. Die Ausgangsbasis bewahrt die ursprünglichen Ergebnisse der ersten Runde.

Vollständige Methodik und Fragen

So funktioniert es

Die Aufgabenbeschreibung führt jede Form der Vorlage mit exakten Zahlen auf. Jedes Modell antwortet ausschließlich mit JSON: bis zu 150 Quader, jeweils mit einer Position, einer Größe und einer von 11 Farben. Das Modell zeichnet selbst nichts. Wenn ein Durchlauf bewertet wird, rendern wir seine Quader und die Vorlage aus denselben kleinen Würfeln, mit derselben Beleuchtung und Kamera, und veröffentlichen die Bilder.

Die Punktzahl ergibt sich aus der Volumenüberlappung zwischen Skulptur und Vorlage (Schnittmenge geteilt durch Vereinigungsmenge, gemessen in 1 cm großen Würfeln), multipliziert mit dem Anteil der überlappenden Würfel, die die richtige Farbe haben. Ein Quader pro Form ergibt weniger als 40 Punkte; wird jede Form in gleich große Scheiben zerlegt, sind es etwa 50 Punkte. Schräge Beine, dünne Kabel und runde Köpfe belohnen Modelle, die die Platzierung jedes Quaders planen. Die Ansicht „Unterschied“ zeigt jeden fehlenden, zusätzlichen und falsch eingefärbten Würfel.

Fair und wiederholbar

Die Ausgangsbasis ist die ursprüngliche erste Runde, deren tatsächliche Messdaten erhalten bleiben. Für den Launch wurde eine zweite gemessene Runde angefordert. Beide werden angezeigt; keine wird rückdatiert oder als bestes Ergebnis aus zwei Runden ausgewählt. Spätere Runden folgen dem wöchentlichen Zeitplan.

  • Jede Woche dieselbe Aufgabenbeschreibung, dasselbe Bewertungsprogramm und dieselben Einstellungen. Die Aufgabenbeschreibung v3 hat den Fingerabdruck 08fb5a5773fe89e7; jede Änderung beginnt eine neue Version mit einem neuen Diagramm.
  • Jedes Modell antwortet einmal mit mittlerem Denkaufwand über Claude Code oder Codex, mit einem Abo angemeldet, genauso wie VibeiDE die Modelle ausführt. Keine Tools, kein Webzugriff, keine Wiederholungsversuche, keine Auswahl der besten von N Antworten.
  • Die Modelle laufen nacheinander, nie parallel. Eine Antwort, die nicht innerhalb von 40 Minuten eintrifft, erhält 0 Punkte.
  • Das Bewertungsprogramm ist deterministisch. Kein Modell bewertet ein anderes Modell.

Lies die vollständige Aufgabenbeschreibung (Klartext, 7,691 Zeichen). Die Modellnamen sind die Aliasnamen, die die jeweilige CLI anbietet; die Seite erfasst die von der CLI gemeldete Modellkennung.

Fragen

Werden Claude oder GPT schlechter gemacht?

Diese Seite kann nicht hinter die Kulissen eines Anbieters schauen. Sie zeigt aber, ob dasselbe Modell unter demselben Namen bei derselben unveränderten Aufgabe im Laufe der Zeit anders abschneidet. Ein Durchlauf pro Woche ist nur eine einzelne Stichprobe. Betrachte eine Veränderung um wenige Punkte deshalb als Rauschen und einen Rückgang über mehrere Wochen als Signal.

Warum erreicht kein Modell 100 Punkte?

Die Vorlage besteht aus Kugeln, Ellipsoiden, Zylindern und schrägen Kapselformen, während die Antwort nur 150 achsenparallele Quader verwenden darf. Quader können Rundungen nicht exakt nachbilden, deshalb geht bei jeder Antwort etwas Volumen verloren. Bessere Modelle setzen ihre Quader gezielt an den Rundungen ein, sodass ihre Skulpturen der Vorlage stärker ähneln.

Wie werden die Modelle ausgeführt?

Jedes Modell erhält die Aufgabenbeschreibung einmal über sein offizielles Kommandozeilenwerkzeug, Claude Code oder Codex, angemeldet mit einem regulären Abonnement und mit mittlerem Denkaufwand. Werkzeuge, Unteragenten, Webzugriff und Wiederholungsversuche sind deaktiviert; ein Durchlauf, der ein Werkzeug verwendet, erhält 0 Punkte. Die Antwort wird von einem deterministischen Programm bewertet, nicht von einem anderen Modell.

Warum wurde der Benchmark auf v3 umgestellt?

In den ersten beiden Versionen sollten die Modelle ein Büro einrichten. In den ersten Runden erreichten die besten Modelle 100 und 92 Punkte, und jedes korrekt eingerichtete Büro sah gleich aus. Ein Benchmark, bei dem Spitzenmodelle die Höchstpunktzahl erreichen, kann keine Veränderungen sichtbar machen. Wenn alle Antworten gleich aussehen, lässt sich auch die Qualität nicht erkennen. Deshalb verlangt v3 eine Skulptur, deren Qualität auf einen Blick sichtbar ist.

Kann ich die Aufgabe selbst ausprobieren?

Ja. Die vollständige Aufgabenbeschreibung ist als Klartext öffentlich zugänglich. Füge sie in ein beliebiges Modell ein und vergleiche seine Antwort mit der Vorlage.

Sprachen

Necessary cookies support sign-in, security, your language and this choice. Optional categories stay off until accepted.

First-party page views and acquisition measurement, plus Google Analytics 4 (Google Ireland, data may reach the US). Advertising personalization stays off.

With Analytics enabled, retain Google and Microsoft ad click identifiers and share download, signup, activation and purchase conversions with the relevant ad provider. No personalized advertising.

Remember referral credit for later. Links still work on the current page without this cookie.

Privacy · Cookie inventory