Benchmark de escritório
Qual é a IA que constrói melhor?
Seis modelos. Um enunciado. Uma tentativa por modelo. Pontuação de 0 a 100 por comparação com o alvo exato.
Classificação.
O que cada modelo construiu.
Resultado em bruto, renderizado a partir do JSON devolvido por cada modelo. Uma tentativa, sem repetições.
Todas as esculturas usam a mesma iluminação, câmara e escala. Selecione qualquer resultado para o comparar com o modelo a reproduzir, ou mude para Diferença para examinar as discrepâncias.
Notas
Qualidade, tokens e tempo
Que recursos foram necessários para cada resultado?
Compare a pontuação, a soma dos tokens de entrada e de saída reportados e o tempo de execução decorrido na ronda selecionada. Os tokens de raciocínio não são somados novamente. As medições em falta são excluídas, não contabilizadas como zero.
Ver as medições de tokens e tempo de execução
Resultados medidos
Ronda após ronda.
A referência inicial preserva os resultados originais da primeira ronda e as datas das medições. O ponto seguinte corresponde a uma nova ronda de medições, não a um resultado de outra semana.
Ver as pontuações registadas
| Ronda | Claude Opus 5 / Claude Opus 5.5 | Claude Sonnet 5 / Claude Sonnet 5.5 | Claude Fable | GPT-6.1 Sol | GPT-6 Astra | GPT-6 Luna |
|---|---|---|---|---|---|---|
| 2026-W41 | 78.5 (Claude Opus 5.5) | 48.1 (Claude Sonnet 5.5) | 74.6 (Claude Fable) | 74.7 (GPT-6.1 Sol) | 73.5 (GPT-6 Astra) | 30.9 (GPT-6 Luna) |
| Referência inicial | 75.5 (Claude Opus 5) | 34.3 (Claude Sonnet 5) | 71.2 (Claude Fable) | 70.6 (GPT-6.1 Sol) | 77.5 (GPT-6 Astra) | 45.6 (GPT-6 Luna) |
Sobre o benchmark
Dê 150 caixas a uma IA. Peça-lhe isto.
Uma cabeça redonda. Uma cadeira curva. Um pequeno candeeiro de secretária. Até que ponto consegue um modelo de linguagem aproximar-se usando apenas blocos retangulares?
- blocos no máximo
- 150
- modelos
- 6
- tentativa por ronda
- 1
Como funciona.
Um enunciado fixo.
Todos os modelos recebem o mesmo enunciado escrito com as dimensões e as cores do alvo. O enunciado completo é público.
Apenas JSON.
A resposta não contém mais nada: até 150 caixas com posições, dimensões e cores.
Uma tentativa.
Esforço de raciocínio médio, sem ferramentas nem novas tentativas. São registados os tokens e o tempo de execução.
Um sistema de pontuação fixo.
Sobreposição de volume com o alvo, ponderada pela precisão das cores, de 0 a 100.
A fórmula
percentagem de sobreposição de volume × proporção de cubos com a cor corretaMedido em unidades de 1 cm³. Impressão digital do enunciado 08fb5a5773fe89e7. A referência inicial preserva os resultados originais da primeira ronda.
Metodologia completa e perguntas
Como funciona
As instruções enumeram todas as formas do modelo de referência com valores exatos. Cada modelo responde apenas em JSON: até 150 blocos, cada um com uma posição, um tamanho e uma de 11 cores. O modelo não desenha nada por si próprio. Quando atribuímos uma pontuação a uma execução, renderizamos os seus blocos e o modelo de referência com os mesmos pequenos cubos, com a mesma iluminação e câmara, e publicamos as imagens.
A pontuação corresponde à sobreposição de volume entre a escultura e o modelo de referência (interseção sobre união, medida em cubos de 1 cm), multiplicada pela proporção de cubos comuns com a cor correta. Usar uma caixa por forma dá menos de 40 pontos; dividir todas as formas em fatias iguais dá cerca de 50. As pernas inclinadas, os cabos finos e as cabeças redondas favorecem os modelos que planeiam a posição de cada caixa, e a vista Diferença mostra todos os cubos em falta, a mais ou com a cor incorreta.
Justo e repetível
A referência inicial corresponde à primeira ronda original, preservada com as datas reais das medições. Foi solicitada uma segunda ronda de medições para o lançamento. Ambas são apresentadas; nenhuma tem datas retroativas nem é escolhida por ser o melhor dos dois resultados. As rondas seguintes seguem o calendário semanal.
- O mesmo enunciado, o mesmo programa de avaliação e as mesmas definições todas as semanas. O enunciado v3 tem a impressão digital
08fb5a5773fe89e7; qualquer alteração dá início a uma nova versão e a um novo gráfico. - Cada modelo responde uma vez com um nível médio de esforço de raciocínio, através do Claude Code ou do Codex com sessão iniciada através de uma subscrição, da mesma forma que o VibeiDE os executa. Sem ferramentas, sem Web, sem novas tentativas e sem seleção da melhor de N respostas.
- Os modelos são executados um após o outro, nunca em paralelo. Uma resposta que não chegue no prazo de 40 minutos recebe 0 pontos.
- O programa de avaliação é determinístico. Nenhum modelo avalia outro modelo.
Leia o enunciado completo (texto simples, 7,691 caracteres). Os nomes dos modelos são os aliases disponibilizados por cada CLI; a página regista o identificador do modelo comunicado pela CLI.
Perguntas
Estão a reduzir as capacidades do Claude ou do GPT?
Esta página não permite ver o que se passa dentro de um fornecedor, mas mostra se o mesmo nome de modelo obtém pontuações diferentes na mesma tarefa fixa ao longo do tempo. Uma execução por semana é uma única amostra, por isso encare uma variação de alguns pontos como ruído e uma queda que persiste durante várias semanas como um sinal.
Porque é que nenhum modelo consegue chegar aos 100?
O modelo de referência é composto por esferas, elipsoides, cilindros e cápsulas inclinadas, mas a resposta só pode usar 150 caixas alinhadas com os eixos. As caixas não conseguem acompanhar as curvas com exatidão, pelo que todas as respostas perdem algum volume. Os melhores modelos concentram as caixas nas zonas curvas e as suas esculturas assemelham-se mais ao modelo de referência.
Como são executados os modelos?
Cada modelo recebe o enunciado uma única vez através da sua ferramenta oficial de linha de comandos, Claude Code ou Codex, com sessão iniciada numa subscrição normal e um nível médio de esforço de raciocínio. As ferramentas, os subagentes, o acesso à Web e as novas tentativas estão desativados; uma execução que use uma ferramenta recebe 0 pontos. A resposta é avaliada por um programa determinístico, não por outro modelo.
Porque é que o teste de referência mudou para a v3?
As primeiras duas versões pediam aos modelos que organizassem um escritório. Nas primeiras rondas, os melhores modelos obtiveram 100 e 92 pontos, e todos os escritórios corretos tinham o mesmo aspeto. Um teste de referência em que os melhores modelos atingem a pontuação máxima não permite mostrar evolução, e um teste em que as respostas são semelhantes não permite mostrar qualidade. Por isso, a v3 pede uma escultura cuja qualidade seja visível à primeira vista.
Posso experimentar o enunciado?
Sim. O enunciado completo está disponível publicamente em texto simples. Cole-o em qualquer modelo e compare a resposta com o modelo de referência.