Prueba comparativa de Office
¿Qué IA construye mejor?
Seis modelos. Las mismas instrucciones. Un intento por modelo. Puntuación de 0 a 100 según la correspondencia con el objetivo exacto.
Clasificación.
Qué construyó cada modelo.
Resultado sin modificar, renderizado a partir del JSON que devolvió cada modelo. Un solo intento, sin reintentos.
Todas las esculturas usan la misma iluminación, cámara y escala. Selecciona cualquier resultado para compararlo con el objetivo o cambia a Diferencia para examinar las discrepancias.
Notas
Calidad, tokens y tiempo
¿Qué recursos requirió cada resultado?
Compara la puntuación, la suma de los tokens de entrada y salida declarados y el tiempo de ejecución transcurrido para la ronda seleccionada. Los tokens de razonamiento no se vuelven a sumar. Las mediciones que faltan se omiten, no se contabilizan como cero.
Consulta las mediciones de tokens y tiempo de ejecución
Resultados medidos
Ronda tras ronda.
La referencia inicial conserva los resultados originales de la primera ronda y las fechas de medición. El siguiente punto corresponde a una nueva ronda medida, no a un resultado de otra semana.
Consulta las puntuaciones registradas
| Ronda | Claude Opus 5 / Claude Opus 5.5 | Claude Sonnet 5 / Claude Sonnet 5.5 | Claude Fable | GPT-6.1 Sol | GPT-6 Astra | GPT-6 Luna |
|---|---|---|---|---|---|---|
| 2026-W41 | 78.5 (Claude Opus 5.5) | 48.1 (Claude Sonnet 5.5) | 74.6 (Claude Fable) | 74.7 (GPT-6.1 Sol) | 73.5 (GPT-6 Astra) | 30.9 (GPT-6 Luna) |
| Referencia inicial | 75.5 (Claude Opus 5) | 34.3 (Claude Sonnet 5) | 71.2 (Claude Fable) | 70.6 (GPT-6.1 Sol) | 77.5 (GPT-6 Astra) | 45.6 (GPT-6 Luna) |
Acerca de la prueba comparativa
Dale 150 cajas a una IA. Pídele esto.
Una cabeza redonda. Una silla curva. Una pequeña lámpara de escritorio. ¿Hasta qué punto puede acercarse un modelo de lenguaje usando solo bloques rectangulares?
- bloques como máximo
- 150
- modelos
- 6
- intento por ronda
- 1
Cómo funciona.
Instrucciones fijas.
Todos los modelos reciben las mismas instrucciones escritas, con las dimensiones y los colores del objetivo. Las instrucciones completas son públicas.
Solo JSON.
La respuesta no contiene nada más: hasta 150 cajas con sus posiciones, tamaños y colores.
Un solo intento.
Esfuerzo de razonamiento medio, sin herramientas ni reintentos. Se registran los tokens y el tiempo de ejecución.
Un sistema de puntuación fijo.
Superposición de volumen con el objetivo, ponderada por la precisión del color, de 0 a 100.
La fórmula
porcentaje de superposición de volumen × proporción de cubos con el color correctoMedido en unidades de 1 cm³. Huella digital de las instrucciones 08fb5a5773fe89e7. La referencia inicial conserva los resultados originales de la primera ronda.
Metodología completa y preguntas
Cómo funciona
El encargo enumera todas las formas del modelo de referencia con valores numéricos exactos. Cada modelo responde únicamente con JSON: hasta 150 bloques, cada uno con una posición, un tamaño y uno de los 11 colores. El modelo no dibuja nada por sí mismo. Al puntuar una ejecución, renderizamos sus bloques y el modelo de referencia con los mismos cubos pequeños, la misma iluminación y la misma cámara, y publicamos las imágenes.
La puntuación es el solapamiento de volumen entre la escultura y el modelo de referencia (intersección sobre unión, medida en cubos de 1 cm) multiplicado por la proporción de cubos compartidos que tienen el color correcto. Usar una caja por forma da menos de 40 puntos; dividir cada forma en láminas iguales da unos 50. Las patas inclinadas, los cables finos y las cabezas redondas favorecen a los modelos que planifican dónde colocar cada caja, y la vista Diferencia muestra todos los cubos ausentes, sobrantes y de color incorrecto.
Justo y reproducible
La referencia inicial es la primera ronda original, conservada con sus fechas reales de medición. Se solicitó una segunda ronda medida para el lanzamiento. Se muestran ambas; a ninguna se le asigna una fecha anterior ni se elige la mejor de las dos como resultado. Las rondas posteriores siguen el calendario semanal.
- Las mismas instrucciones, el mismo programa de puntuación y los mismos ajustes cada semana. Las instrucciones v3 tienen la huella digital
08fb5a5773fe89e7; cualquier cambio inicia una nueva versión y un nuevo gráfico. - Cada modelo responde una sola vez con un nivel de esfuerzo de razonamiento medio, a través de Claude Code o Codex con una sesión iniciada mediante una suscripción, del mismo modo que los ejecuta VibeiDE. Sin herramientas, sin web, sin reintentos y sin elegir la mejor de N respuestas.
- Los modelos se ejecutan uno tras otro, nunca en paralelo. Una respuesta que no llega en 40 minutos obtiene 0.
- El programa de evaluación es determinista. Ningún modelo evalúa a otro.
Lee las instrucciones completas (texto sin formato, 7,691 caracteres). Los nombres de los modelos son los alias que ofrece cada CLI; la página registra el identificador del modelo que comunicó la CLI.
Preguntas
¿Están reduciendo las capacidades de Claude o GPT?
Esta página no puede ver lo que ocurre dentro de un proveedor, pero muestra si un mismo nombre de modelo obtiene puntuaciones distintas en una misma tarea fija a lo largo del tiempo. Una ejecución semanal es una sola muestra, así que considera las variaciones de unos pocos puntos como ruido y una caída que se mantenga durante varias semanas como una señal.
¿Por qué ningún modelo puede alcanzar los 100 puntos?
El modelo de referencia está formado por esferas, elipsoides, cilindros y cápsulas inclinadas, y la respuesta solo puede usar 150 cajas alineadas con los ejes. Las cajas no pueden seguir las curvas con exactitud, por lo que todas las respuestas pierden algo de volumen. Los mejores modelos concentran sus cajas en las zonas curvas, y sus esculturas se parecen más al modelo de referencia.
¿Cómo se ejecutan los modelos?
Cada modelo recibe las instrucciones una sola vez a través de su herramienta oficial de línea de comandos, Claude Code o Codex, con una suscripción normal y un nivel de razonamiento medio. Las herramientas, los subagentes, el acceso a la web y los reintentos están desactivados; cualquier ejecución que use una herramienta recibe 0 puntos. Un programa determinista puntúa la respuesta, no otro modelo.
¿Por qué la prueba pasó a la v3?
Las dos primeras versiones pedían a los modelos que distribuyeran una oficina. En sus primeras rondas, los mejores modelos obtuvieron 100 y 92 puntos, y todas las oficinas correctas tenían el mismo aspecto. Una prueba en la que los mejores modelos alcanzan la puntuación máxima no permite apreciar cambios, y una en la que las respuestas se parecen no permite apreciar la calidad. Por eso, la v3 pide una escultura cuya calidad se pueda apreciar de un vistazo.
¿Puedo probar las instrucciones por mi cuenta?
Sí. Las instrucciones completas son públicas y están disponibles en texto sin formato. Pégalas en cualquier modelo y compara su respuesta con el modelo de referencia.