Benchmark Office
Quale IA costruisce meglio?
Sei modelli. Un brief. Un solo tentativo ciascuno. Punteggi da 0 a 100 in base alla corrispondenza esatta con il modello di riferimento.
Classifica.
Cosa ha costruito ogni modello.
Output grezzo, visualizzato a partire dal JSON restituito da ciascun modello. Un solo tentativo, senza riprovare.
Ogni scultura usa la stessa illuminazione, la stessa inquadratura e la stessa scala. Seleziona un risultato per confrontarlo con il modello da riprodurre, oppure passa alla vista Differenze per esaminare le discrepanze.
Note
Qualità, token e tempo
Quali risorse ha richiesto ciascun risultato?
Confronta il punteggio, la somma dei token di input e output riportati e il tempo di esecuzione del ciclo selezionato. I token di ragionamento non vengono conteggiati una seconda volta. Le misurazioni mancanti vengono escluse, non considerate pari a zero.
Visualizza le misurazioni dei token e dei tempi di esecuzione
Risultati misurati
Un round dopo l'altro.
Il riferimento iniziale conserva i risultati originali del primo ciclo e le relative date di misurazione. Il punto successivo rappresenta un nuovo ciclo misurato, non un risultato di un'altra settimana.
Visualizza i punteggi registrati
| Ciclo | Claude Opus 5 / Claude Opus 5.5 | Claude Sonnet 5 / Claude Sonnet 5.5 | Claude Fable | GPT-6.1 Sol | GPT-6 Astra | GPT-6 Luna |
|---|---|---|---|---|---|---|
| 2026-W41 | 78.5 (Claude Opus 5.5) | 48.1 (Claude Sonnet 5.5) | 74.6 (Claude Fable) | 74.7 (GPT-6.1 Sol) | 73.5 (GPT-6 Astra) | 30.9 (GPT-6 Luna) |
| Riferimento iniziale | 75.5 (Claude Opus 5) | 34.3 (Claude Sonnet 5) | 71.2 (Claude Fable) | 70.6 (GPT-6.1 Sol) | 77.5 (GPT-6 Astra) | 45.6 (GPT-6 Luna) |
Informazioni sul benchmark
Dai a un'IA 150 parallelepipedi. Chiedile di costruire questo.
Una testa rotonda. Una sedia curva. Una piccola lampada da scrivania. Quanto può avvicinarsi un modello linguistico usando solo blocchi rettangolari?
- blocchi al massimo
- 150
- modelli
- 6
- tentativo per ciclo
- 1
Come funziona.
Un brief fisso.
Ogni modello riceve lo stesso brief scritto, con le dimensioni e i colori del modello di riferimento. Il brief completo è pubblico.
Solo JSON.
La risposta non contiene altro: fino a 150 parallelepipedi con posizioni, dimensioni e colori.
Un solo tentativo.
Livello di ragionamento medio, senza strumenti e senza riprovare. Vengono registrati i token e il tempo di esecuzione.
Un sistema di valutazione fisso.
Sovrapposizione dei volumi rispetto al modello di riferimento, ponderata in base all'accuratezza dei colori, da 0 a 100.
La formula
percentuale di sovrapposizione dei volumi × quota di cubi con il colore correttoMisurata in unità di 1 cm³. Impronta digitale del brief 08fb5a5773fe89e7. La base di confronto iniziale conserva i risultati originali del primo round.
Metodologia completa e domande
Come funziona
Le istruzioni elencano tutte le forme del modello di riferimento con valori numerici esatti. Ogni modello risponde esclusivamente in JSON: fino a 150 parallelepipedi, ciascuno definito da una posizione, dimensioni e uno degli 11 colori. Il modello non disegna nulla direttamente. Quando valutiamo un'esecuzione, renderizziamo i suoi parallelepipedi e il modello di riferimento usando gli stessi piccoli cubi, con la stessa illuminazione e la stessa inquadratura, e pubblichiamo le immagini.
Il punteggio è dato dalla sovrapposizione dei volumi della scultura e del modello di riferimento (intersezione divisa per unione, misurata in cubi da 1 cm), moltiplicata per la percentuale di cubi condivisi con il colore corretto. Usare un parallelepipedo per forma dà un punteggio inferiore a 40; suddividere ogni forma in strati uguali dà un punteggio di circa 50. Gambe inclinate, cavi sottili e teste rotonde premiano i modelli che pianificano dove collocare ogni parallelepipedo, e la vista Differenza mostra ogni cubo mancante, in eccesso o del colore sbagliato.
Equo e ripetibile
Il riferimento iniziale è il primo ciclo originale, conservato con le date effettive di misurazione. Per il lancio è stato richiesto un secondo ciclo misurato. Vengono mostrati entrambi: nessuno dei due è retrodatato e non viene selezionato soltanto il migliore dei due risultati. I cicli successivi seguono la cadenza settimanale.
- Ogni settimana si usano la stessa consegna, lo stesso programma di valutazione e le stesse impostazioni. La consegna v3 ha l'impronta
08fb5a5773fe89e7; qualsiasi modifica dà inizio a una nuova versione e a un nuovo grafico. - Ogni modello risponde una sola volta con un livello medio di ragionamento, tramite Claude Code o Codex con accesso tramite abbonamento, proprio come li esegue VibeiDE. Nessuno strumento, nessun accesso al web, nessun nuovo tentativo e nessuna selezione della migliore risposta tra N tentativi.
- I modelli vengono eseguiti uno dopo l'altro, mai in parallelo. Una risposta che non arriva entro 40 minuti ottiene 0.
- Il programma di valutazione è deterministico. Nessun modello valuta un altro modello.
Leggi la consegna completa (testo semplice, 7,691 caratteri). I nomi dei modelli sono gli alias offerti da ciascuna CLI; la pagina registra l'identificatore del modello riportato dalla CLI.
Domande
Claude o GPT stanno diventando meno capaci?
Questa pagina non può sapere cosa succede all'interno di un fornitore, ma mostra se lo stesso nome di modello ottiene punteggi diversi nel tempo sulla stessa prova invariata. Una sola esecuzione a settimana è un singolo campione: considera quindi uno scostamento di pochi punti come rumore e un calo che dura diverse settimane come un segnale.
Perché nessun modello riesce a raggiungere 100?
Il modello di riferimento è composto da sfere, ellissoidi, cilindri e capsule inclinate, mentre la risposta può usare solo 150 parallelepipedi allineati agli assi. I parallelepipedi non possono seguire esattamente le curve, quindi ogni risposta perde una parte del volume. I modelli migliori concentrano i parallelepipedi dove ci sono le curve e producono sculture più simili al modello di riferimento.
Come vengono eseguiti i modelli?
Ogni modello riceve la consegna una sola volta tramite il proprio strumento ufficiale da riga di comando, Claude Code o Codex, con accesso tramite un normale abbonamento e un livello di ragionamento medio. Strumenti, sottoagenti, accesso al web e nuovi tentativi sono disattivati; un'esecuzione che usa uno strumento riceve un punteggio di 0. La risposta viene valutata da un programma deterministico, non da un altro modello.
Perché il benchmark è passato alla v3?
Le prime due versioni chiedevano ai modelli di progettare la disposizione di un ufficio. Nei primi round, i modelli migliori hanno ottenuto 100 e 92, e tutti gli uffici corretti avevano lo stesso aspetto. Un benchmark in cui i modelli migliori raggiungono il massimo non può mostrare i progressi, e uno in cui le risposte si assomigliano non può mostrare la qualità. Per questo la v3 richiede una scultura la cui qualità sia visibile a colpo d'occhio.
Posso provare la consegna?
Sì. La consegna completa è pubblica e disponibile come testo semplice. Incollala in un qualsiasi modello e confronta la sua risposta con il modello di riferimento.