Test comparativ Office

Care AI construiește cel mai bine?

Șase modele. Aceleași cerințe. O singură încercare pentru fiecare. Punctaje de la 0 la 100, în funcție de cât de fidel reproduc ținta.

Clasament.

Ce a construit fiecare model.

Rezultatul brut, redat vizual din JSON-ul returnat de fiecare model. O singură încercare, fără reluări.

Săptămâna 2026-W41

Toate sculpturile folosesc aceeași iluminare, aceeași cameră și aceeași scară. Selectează orice rezultat pentru a-l compara cu ținta sau treci la Diferență pentru a examina nepotrivirile.

  1. Claude Opus 5.578.5/100Sculptura Claude Opus 5.5
  2. GPT-6.1 Sol74.7/100Sculptura GPT-6.1 Sol
  3. Claude Fable74.6/100Sculptura Claude Fable
  4. GPT-6 Astra73.5/100Sculptura GPT-6 Astra
  5. Claude Sonnet 5.548.1/100Sculptura Claude Sonnet 5.5
  6. GPT-6 Luna30.9/100Sculptura GPT-6 Luna

Calitate, tokenuri și timp

Ce resurse a necesitat fiecare rezultat?

Compară scorul, totalul raportat al tokenurilor de intrare și de ieșire și durata execuției pentru runda selectată. Tokenurile de raționament nu sunt adăugate din nou. Măsurătorile lipsă sunt omise, nu sunt considerate zero.

Vezi măsurătorile consumului de tokenuri și ale duratei execuției

Rezultate măsurate

De la o rundă la alta.

Referința inițială păstrează rezultatele originale din prima rundă și datele măsurătorilor. Următorul punct reprezintă o rundă nouă de măsurători, nu un rezultat dintr-o altă săptămână.

Vezi scorurile înregistrate
Scor din 100 pentru fiecare rundă
RundăClaude Opus 5 / Claude Opus 5.5Claude Sonnet 5 / Claude Sonnet 5.5Claude FableGPT-6.1 SolGPT-6 AstraGPT-6 Luna
2026-W4178.5 (Claude Opus 5.5)48.1 (Claude Sonnet 5.5)74.6 (Claude Fable)74.7 (GPT-6.1 Sol)73.5 (GPT-6 Astra)30.9 (GPT-6 Luna)
Referința inițială75.5 (Claude Opus 5)34.3 (Claude Sonnet 5)71.2 (Claude Fable)70.6 (GPT-6.1 Sol)77.5 (GPT-6 Astra)45.6 (GPT-6 Luna)

Despre testul comparativ

Dă-i unui AI 150 de paralelipipede. Cere-i să construiască asta.

Un cap rotund. Un scaun curbat. O veioză mică de birou. Cât de aproape poate ajunge un model lingvistic folosind doar blocuri dreptunghiulare?

Ținta: un robot alb pe un scaun verde, la un birou rotund cu un monitor, o veioză, o cană și o plantă
Sculptura de reprodus. 56 de forme.
de blocuri maximum
150
modele
6
încercare pe rundă
1

Cum funcționează.

Cerințe fixe.

Fiecare model primește aceleași cerințe scrise, cu dimensiunile și culorile țintei. Textul integral al cerințelor este public.

Doar JSON.

Răspunsul nu conține nimic altceva: cel mult 150 de paralelipipede, cu poziții, dimensiuni și culori.

O singură încercare.

Efort de raționament mediu, fără instrumente, fără reluări. Sunt monitorizate numărul de tokenuri și durata execuției.

Un evaluator fix.

Suprapunerea volumului cu ținta, ponderată în funcție de precizia culorilor, de la 0 la 100.

Formula

procentul de suprapunere a volumului × proporția cuburilor colorate corect

Măsurat în unități de 1 cm³. Amprenta cerințelor 08fb5a5773fe89e7. Referința inițială păstrează rezultatele originale din prima rundă.

Metodologia completă și întrebări

Cum funcționează

Cerința enumeră toate formele modelului de referință, cu valori numerice exacte. Fiecare model AI răspunde doar în JSON: până la 150 de blocuri, fiecare având o poziție, dimensiuni și una dintre cele 11 culori. Modelul AI nu desenează nimic singur. Când evaluăm o execuție, randăm blocurile sale și modelul de referință din aceleași cuburi mici, cu aceeași iluminare și aceeași cameră, apoi publicăm imaginile.

Scorul reprezintă suprapunerea volumetrică dintre sculptură și modelul de referință (raportul dintre intersecție și reuniune, măsurat în cuburi de 1 cm), înmulțită cu proporția cuburilor comune care au culoarea corectă. Folosirea unui singur paralelipiped pentru fiecare formă obține un scor sub 40; împărțirea fiecărei forme în felii egale obține aproximativ 50. Picioarele înclinate, cablurile subțiri și capetele rotunde favorizează modelele care planifică poziția fiecărui paralelipiped, iar vizualizarea Diferențe arată fiecare cub lipsă, în plus sau colorat greșit.

Corect și repetabil

Referința inițială este prima rundă originală, păstrată cu datele reale ale măsurătorilor. Pentru lansare a fost solicitată o a doua rundă de măsurători. Sunt afișate ambele; niciuna nu este antedatată sau selectată drept cel mai bun rezultat dintre cele două. Rundele ulterioare urmează programul săptămânal.

  • Aceeași cerință, același program de evaluare și aceleași setări în fiecare săptămână. Cerința v3 are amprenta 08fb5a5773fe89e7; orice modificare începe o versiune nouă și un grafic nou.
  • Fiecare model răspunde o singură dată, cu un nivel mediu de efort de raționament, prin Claude Code sau Codex, autentificat cu un abonament, în același mod în care îl rulează VibeiDE. Fără instrumente, fără web, fără reîncercări și fără selectarea celui mai bun răspuns din N încercări.
  • Modelele rulează unul după altul, niciodată în paralel. Un răspuns care nu sosește în 40 de minute primește 0 puncte.
  • Programul de evaluare este determinist. Niciun model nu evaluează un alt model.

Citește cerința completă (text simplu, 7,691 de caractere). Numele modelelor sunt aliasurile oferite de fiecare CLI; pagina înregistrează identificatorul modelului raportat de CLI.

Întrebări

Sunt reduse performanțele modelelor Claude sau GPT?

Această pagină nu poate vedea ce se întâmplă în interiorul unui furnizor, dar arată dacă un model cu același nume obține punctaje diferite în timp pentru aceeași sarcină fixă. O rulare pe săptămână reprezintă o singură observație, așa că tratează o variație de câteva puncte ca zgomot și o scădere care persistă mai multe săptămâni ca semnal.

De ce nu poate niciun model să ajungă la 100?

Modelul de referință este alcătuit din sfere, elipsoizi, cilindri și capsule înclinate, iar răspunsul poate folosi doar 150 de paralelipipede aliniate cu axele. Paralelipipedele nu pot urmări exact curbele, așa că fiecare răspuns pierde o parte din volum. Modelele mai bune își folosesc paralelipipedele acolo unde sunt curbele, iar sculpturile lor seamănă mai mult cu modelul de referință.

Cum sunt rulate modelele?

Fiecare model primește cerința o singură dată prin instrumentul său oficial de linie de comandă, Claude Code sau Codex, autentificat cu un abonament obișnuit și cu efortul de raționament setat la nivel mediu. Instrumentele, subagenții, accesul la web și reîncercările sunt dezactivate; o rulare care folosește un instrument primește scorul 0. Răspunsul este evaluat de un program determinist, nu de un alt model.

De ce a trecut testul comparativ la v3?

Primele două versiuni le cereau modelelor să amenajeze un birou. În primele runde, cele mai bune modele au obținut scoruri de 100 și 92, iar toate birourile realizate corect arătau la fel. Un test comparativ la care modelele de top ating scorul maxim nu poate evidenția progresul, iar unul în care răspunsurile arată la fel nu poate evidenția calitatea. De aceea, v3 cere o sculptură a cărei calitate se vede dintr-o privire.

Pot încerca și eu cerințele?

Da. Cerința completă este publică, în format text simplu. Lipește-o în orice model și compară răspunsul cu modelul de referință.

Limbi

Necessary cookies support sign-in, security, your language and this choice. Optional categories stay off until accepted.

First-party page views and acquisition measurement, plus Google Analytics 4 (Google Ireland, data may reach the US). Advertising personalization stays off.

With Analytics enabled, retain Google and Microsoft ad click identifiers and share download, signup, activation and purchase conversions with the relevant ad provider. No personalized advertising.

Remember referral credit for later. Links still work on the current page without this cookie.

Privacy · Cookie inventory