Proba comparativa de oficina
Que IA constrúe mellor?
Seis modelos. Unhas mesmas instrucións. Un único intento por modelo. Puntuación de 0 a 100 segundo a coincidencia co obxectivo exacto.
Clasificación.
O que construíu cada modelo.
Saída sen modificar, renderizada a partir do JSON devolto por cada modelo. Un único intento, sen repeticións.
Todas as esculturas usan a mesma iluminación, cámara e escala. Selecciona calquera resultado para comparalo co obxectivo ou cambia a Diferenza para examinar as discrepancias.
Notas
Calidade, tokens e tempo
Que recursos precisou cada resultado?
Compara a puntuación, a suma dos tokens de entrada e saída declarados e o tempo de execución transcorrido na rolda seleccionada. Os tokens de razoamento non se suman de novo. As medicións que faltan omítense, non se contan como cero.
Ver as medicións de tokens e tempo de execución
Resultados medidos
Rolda a rolda.
A referencia inicial conserva os resultados orixinais da primeira rolda e as datas das medicións. O seguinte punto corresponde a unha nova rolda medida, non a un resultado doutra semana.
Ver as puntuacións rexistradas
| Rolda | Claude Opus 5 / Claude Opus 5.5 | Claude Sonnet 5 / Claude Sonnet 5.5 | Claude Fable | GPT-6.1 Sol | GPT-6 Astra | GPT-6 Luna |
|---|---|---|---|---|---|---|
| 2026-W41 | 78.5 (Claude Opus 5.5) | 48.1 (Claude Sonnet 5.5) | 74.6 (Claude Fable) | 74.7 (GPT-6.1 Sol) | 73.5 (GPT-6 Astra) | 30.9 (GPT-6 Luna) |
| Referencia inicial | 75.5 (Claude Opus 5) | 34.3 (Claude Sonnet 5) | 71.2 (Claude Fable) | 70.6 (GPT-6.1 Sol) | 77.5 (GPT-6 Astra) | 45.6 (GPT-6 Luna) |
Sobre a proba comparativa
Dálle 150 caixas a unha IA. Pídelle isto.
Unha cabeza redonda. Unha cadeira curva. Unha pequena lámpada de escritorio. Ata que punto pode achegarse un modelo de linguaxe usando só bloques rectangulares?
- caixas como máximo
- 150
- modelos
- 6
- intento por rolda
- 1
Como funciona.
Unhas instrucións fixas.
Todos os modelos reciben as mesmas instrucións escritas coas dimensións e cores do obxectivo. As instrucións completas son públicas.
Só JSON.
A resposta non contén nada máis: ata 150 caixas coas súas posicións, tamaños e cores.
Un único intento.
Esforzo de razoamento medio, sen ferramentas nin repeticións. Rexístranse os tokens e o tempo de execución.
Un sistema de puntuación fixo.
Solapamento de volume co obxectivo, ponderado pola precisión das cores, de 0 a 100.
A fórmula
porcentaxe de solapamento de volume × proporción de cubos coa cor correctaMedido en unidades de 1 cm³. Pegada dixital das instrucións 08fb5a5773fe89e7. A referencia inicial conserva os resultados orixinais da primeira rolda.
Metodoloxía completa e preguntas
Como funciona
O encargo enumera todas as formas do modelo de referencia con valores exactos. Cada modelo responde só con JSON: ata 150 caixas, cada unha cunha posición, un tamaño e unha das 11 cores. O modelo non debuxa nada por si mesmo. Ao puntuar unha execución, renderizamos as súas caixas e o modelo de referencia cos mesmos cubos pequenos, coa mesma iluminación e cámara, e publicamos as imaxes.
A puntuación é a superposición de volume entre a escultura e o modelo de referencia (intersección sobre unión, medida en cubos de 1 cm) multiplicada pola proporción de cubos compartidos coa cor correcta. Usar unha caixa por forma dá menos de 40 puntos; dividir cada forma en capas iguais dá arredor de 50. As patas inclinadas, os cables finos e as cabezas redondas premian os modelos que planifican onde colocar cada caixa, e a vista Diferenza mostra todos os cubos que faltan, sobran ou teñen unha cor incorrecta.
Xusto e repetible
A referencia inicial é a primeira rolda orixinal, conservada coas datas reais das súas medicións. Solicitouse unha segunda rolda medida para o lanzamento. Móstranse ambas; a ningunha se lle asignou unha data anterior á real nin se escolleu como o mellor resultado das dúas. As roldas posteriores seguen o calendario semanal.
- As mesmas instrucións, o mesmo programa de puntuación e os mesmos axustes cada semana. As instrucións v3 teñen a pegada dixital
08fb5a5773fe89e7; calquera cambio inicia unha nova versión e unha nova gráfica. - Cada modelo responde unha soa vez cun nivel medio de esforzo de razoamento, a través de Claude Code ou Codex cunha sesión iniciada cunha subscrición, do mesmo xeito que os executa VibeiDE. Sen ferramentas, sen web, sen reintentos e sen escoller a mellor de N respostas.
- Os modelos execútanse un tras outro, nunca en paralelo. Unha resposta que non chega no prazo de 40 minutos obtén 0 puntos.
- O programa de puntuación é determinista. Ningún modelo avalía outro modelo.
Le as instrucións completas (texto simple, 7,691 caracteres). Os nomes dos modelos son os alias que ofrece cada CLI; a páxina rexistra o identificador do modelo que comunicou a CLI.
Preguntas
Están a reducir as capacidades de Claude ou GPT?
Esta páxina non pode ver o que ocorre dentro dun provedor, pero amosa se un mesmo nome de modelo obtén puntuacións distintas na mesma tarefa fixa ao longo do tempo. Unha execución por semana é unha soa mostra, así que considera unha variación duns poucos puntos como ruído e unha caída que dura varias semanas como un sinal.
Por que ningún modelo pode chegar a 100?
O modelo de referencia está feito de esferas, elipsoides, cilindros e cápsulas inclinadas, e a resposta só pode usar 150 caixas aliñadas cos eixes. As caixas non poden reproducir as curvas con exactitude, polo que todas as respostas perden algo de volume. Os mellores modelos empregan as caixas onde están as curvas, e as súas esculturas parécense máis ao modelo de referencia.
Como se executan os modelos?
Cada modelo recibe as instrucións unha soa vez a través da súa ferramenta oficial de liña de comandos, Claude Code ou Codex, cunha sesión iniciada cunha subscrición normal e un nivel medio de esforzo de razoamento. As ferramentas, os subaxentes, o acceso á web e os reintentos están desactivados; unha execución que use unha ferramenta recibe 0 puntos. A resposta puntúaa un programa determinista, non outro modelo.
Por que a proba comparativa pasou á v3?
As dúas primeiras versións pedíanlles aos modelos que distribuísen unha oficina. Nas primeiras roldas, os mellores modelos obtiveron 100 e 92 puntos, e todas as oficinas correctas tiñan o mesmo aspecto. Unha proba na que os mellores modelos acadan a puntuación máxima non permite mostrar cambios, e unha na que as respostas se parecen entre si non permite mostrar a calidade, polo que a v3 pide unha escultura cuxa calidade se perciba dunha ollada.
Podo probar o enunciado pola miña conta?
Si. As instrucións completas son públicas e están en texto simple. Pégaas en calquera modelo e compara a súa resposta co modelo de referencia.