Benchmark Office

Quelle IA construit le mieux ?

Six modèles. Une seule consigne. Un seul essai chacun. Une note de 0 à 100 selon la fidélité à la cible exacte.

Classement.

Ce que chaque modèle a construit.

Résultat brut, rendu à partir du JSON renvoyé par chaque modèle. Un seul essai, sans nouvelle tentative.

Semaine 2026-W41

Chaque sculpture est présentée avec le même éclairage, le même réglage de caméra et la même échelle. Sélectionnez un résultat pour le comparer à la cible, ou passez à la vue Différence pour examiner les écarts.

  1. Claude Opus 5.578.5/100Sculpture de Claude Opus 5.5
  2. GPT-6.1 Sol74.7/100Sculpture de GPT-6.1 Sol
  3. Claude Fable74.6/100Sculpture de Claude Fable
  4. GPT-6 Astra73.5/100Sculpture de GPT-6 Astra
  5. Claude Sonnet 5.548.1/100Sculpture de Claude Sonnet 5.5
  6. GPT-6 Luna30.9/100Sculpture de GPT-6 Luna

Qualité, tokens et durée

Quelles ressources chaque résultat a-t-il nécessitées ?

Comparez le score, le total déclaré des tokens d’entrée et de sortie, ainsi que la durée d’exécution du cycle sélectionné. Les tokens de raisonnement ne sont pas ajoutés une seconde fois. Les mesures manquantes sont exclues et ne sont pas comptées comme des valeurs nulles.

Consultez les mesures de tokens et de durée d’exécution

Résultats mesurés

D’une manche à l’autre.

La référence initiale conserve les résultats d’origine du premier cycle et les dates des mesures. Le point suivant correspond à un nouveau cycle de mesures, et non à un résultat provenant d’une autre semaine.

Consultez les scores enregistrés
Score sur 100 par cycle
CycleClaude Opus 5 / Claude Opus 5.5Claude Sonnet 5 / Claude Sonnet 5.5Claude FableGPT-6.1 SolGPT-6 AstraGPT-6 Luna
2026-W4178.5 (Claude Opus 5.5)48.1 (Claude Sonnet 5.5)74.6 (Claude Fable)74.7 (GPT-6.1 Sol)73.5 (GPT-6 Astra)30.9 (GPT-6 Luna)
Référence initiale75.5 (Claude Opus 5)34.3 (Claude Sonnet 5)71.2 (Claude Fable)70.6 (GPT-6.1 Sol)77.5 (GPT-6 Astra)45.6 (GPT-6 Luna)

À propos du benchmark

Donnez 150 blocs à une IA. Demandez-lui de reproduire ceci.

Une tête ronde. Une chaise incurvée. Une minuscule lampe de bureau. Jusqu’à quel point un modèle de langage peut-il s’en approcher en utilisant uniquement des blocs rectangulaires ?

La cible : un robot blanc assis sur une chaise verte devant un bureau rond avec un écran, une lampe, une tasse et une plante
La sculpture à reproduire. 56 formes.
blocs au maximum
150
modèles
6
tentative par cycle
1

Fonctionnement.

Une consigne figée.

Chaque modèle reçoit la même consigne écrite, qui précise les dimensions et les couleurs de la cible. La consigne complète est publique.

Uniquement du JSON.

La réponse ne contient rien d’autre : jusqu’à 150 blocs avec leurs positions, leurs dimensions et leurs couleurs.

Un seul essai.

Effort de raisonnement moyen, sans outils ni nouvelles tentatives. Le nombre de tokens et le temps d’exécution sont suivis.

Un système de notation figé.

Le recouvrement des volumes avec la cible, pondéré par la justesse des couleurs, donne une note de 0 à 100.

La formule

pourcentage de recouvrement des volumes × proportion de cubes correctement colorés

Mesure par unités de 1 cm³. Empreinte de la consigne 08fb5a5773fe89e7. La référence initiale conserve les résultats originaux de la première manche.

Méthodologie complète et questions

Comment cela fonctionne

La consigne décrit toutes les formes du modèle de référence avec des valeurs numériques exactes. Chaque modèle répond uniquement en JSON : jusqu’à 150 blocs, chacun défini par une position, des dimensions et une couleur parmi 11. Le modèle ne dessine rien lui-même. Lorsqu’un essai est évalué, nous réalisons le rendu de ses blocs et du modèle de référence à partir des mêmes petits cubes, avec le même éclairage et la même caméra, puis nous publions les images.

Le score correspond au chevauchement des volumes de la sculpture et de la cible (intersection sur union, mesurée en cubes de 1 cm), multiplié par la proportion de cubes communs ayant la bonne couleur. Une boîte par forme donne un score inférieur à 40 ; découper chaque forme en tranches égales donne environ 50. Les pieds inclinés, les câbles fins et les têtes rondes favorisent les modèles qui planifient l’emplacement de chaque boîte. La vue Différence montre chaque cube manquant, en trop ou de couleur incorrecte.

Équitable et reproductible

La référence initiale correspond au premier cycle d’origine, conservé avec les dates réelles des mesures. Un deuxième cycle de mesures a été demandé pour le lancement. Les deux sont affichés ; aucun n’est antidaté ni retenu comme le meilleur des deux. Les cycles suivants suivent le calendrier hebdomadaire.

  • Les mêmes consignes, le même programme de calcul du score et les mêmes paramètres chaque semaine. Les consignes v3 ont pour empreinte 08fb5a5773fe89e7 ; toute modification entraîne une nouvelle version et un nouveau graphique.
  • Chaque modèle répond une seule fois avec un effort de raisonnement moyen, via Claude Code ou Codex connecté avec un abonnement, de la même manière que VibeiDE les exécute. Aucun outil, aucun accès au Web, aucune nouvelle tentative, aucune sélection de la meilleure réponse parmi N.
  • Les modèles sont exécutés l’un après l’autre, jamais en parallèle. Une réponse qui n’arrive pas dans les 40 minutes obtient 0.
  • Le programme de notation est déterministe. Aucun modèle n’évalue un autre modèle.

Lire les consignes complètes (texte brut, 7,691 caractères). Les noms des modèles sont les alias proposés par chaque CLI ; la page consigne l’identifiant du modèle communiqué par la CLI.

Questions

Les performances de Claude ou GPT sont-elles bridées ?

Cette page ne permet pas de voir ce qui se passe chez un fournisseur, mais elle montre si un même nom de modèle obtient des scores différents au fil du temps sur une tâche figée. Une exécution par semaine ne représente qu’un seul échantillon : considérez donc une variation de quelques points comme du bruit et une baisse qui dure plusieurs semaines comme un signal.

Pourquoi aucun modèle ne peut-il atteindre 100 ?

La cible se compose de sphères, d’ellipsoïdes, de cylindres et de capsules inclinées, tandis que la réponse ne peut utiliser que 150 boîtes alignées sur les axes. Les boîtes ne peuvent pas épouser exactement les courbes : chaque réponse laisse donc une partie du volume non reproduite. Les meilleurs modèles consacrent leurs boîtes aux zones courbes, et leurs sculptures ressemblent davantage à la cible.

Comment les modèles sont-ils exécutés ?

Chaque modèle reçoit une seule fois les consignes via son outil officiel en ligne de commande, Claude Code ou Codex, avec une connexion utilisant un abonnement standard et un effort de raisonnement moyen. Les outils, les sous-agents, l’accès au Web et les nouvelles tentatives sont désactivés ; toute exécution qui utilise un outil obtient 0. La réponse est évaluée par un programme déterministe, et non par un autre modèle.

Pourquoi le benchmark est-il passé à la v3 ?

Les deux premières versions demandaient aux modèles d’aménager un bureau. Lors de leurs premières sessions, les meilleurs modèles ont obtenu 100 et 92, et tous les bureaux conformes se ressemblaient. Un benchmark où les meilleurs modèles atteignent le score maximal ne permet pas de montrer les progrès, et un benchmark où les réponses se ressemblent ne permet pas de montrer leur qualité. La v3 demande donc une sculpture dont la qualité se voit au premier coup d’œil.

Puis-je essayer le cahier des charges moi-même ?

Oui. Les consignes complètes sont publiques et disponibles en texte brut. Collez-les dans n’importe quel modèle et comparez sa réponse à la cible.

Langues

Necessary cookies support sign-in, security, your language and this choice. Optional categories stay off until accepted.

First-party page views and acquisition measurement, plus Google Analytics 4 (Google Ireland, data may reach the US). Advertising personalization stays off.

With Analytics enabled, retain Google and Microsoft ad click identifiers and share download, signup, activation and purchase conversions with the relevant ad provider. No personalized advertising.

Remember referral credit for later. Links still work on the current page without this cookie.

Privacy · Cookie inventory