Benchmark biurowy

Które AI buduje najlepiej?

Sześć modeli. Jeden brief. Po jednej próbie. Ocena od 0 do 100 za zgodność z dokładnym wzorcem.

Ranking.

Co zbudował każdy model.

Surowe wyniki, wyrenderowane z JSON zwróconego przez każdy model. Jedna próba, bez powtórek.

Tydzień 2026-W41

Każda rzeźba jest prezentowana przy takim samym oświetleniu, ustawieniu kamery i w tej samej skali. Wybierz dowolny wynik, aby porównać go ze wzorem, lub przełącz na widok różnic, aby przyjrzeć się rozbieżnościom.

  1. Claude Opus 5.578.5/100Rzeźba modelu Claude Opus 5.5
  2. GPT-6.1 Sol74.7/100Rzeźba modelu GPT-6.1 Sol
  3. Claude Fable74.6/100Rzeźba modelu Claude Fable
  4. GPT-6 Astra73.5/100Rzeźba modelu GPT-6 Astra
  5. Claude Sonnet 5.548.1/100Rzeźba modelu Claude Sonnet 5.5
  6. GPT-6 Luna30.9/100Rzeźba modelu GPT-6 Luna

Jakość, tokeny i czas

Ile zasobów wymagało uzyskanie każdego wyniku?

Porównaj ocenę, raportowaną sumę tokenów wejściowych i wyjściowych oraz czas wykonania dla wybranej rundy. Tokeny rozumowania nie są doliczane ponownie. Brakujące pomiary są pomijane, a nie traktowane jako zero.

Zobacz pomiary liczby tokenów i czasu wykonania

Wyniki pomiarów

Runda po rundzie.

Początkowy punkt odniesienia zachowuje oryginalne wyniki pierwszej rundy i daty pomiarów. Kolejny punkt to nowa runda z pomiarami, a nie wynik z innego tygodnia.

Zobacz zapisane oceny
Ocena w skali do 100 punktów w każdej rundzie
RundaClaude Opus 5 / Claude Opus 5.5Claude Sonnet 5 / Claude Sonnet 5.5Claude FableGPT-6.1 SolGPT-6 AstraGPT-6 Luna
2026-W4178.5 (Claude Opus 5.5)48.1 (Claude Sonnet 5.5)74.6 (Claude Fable)74.7 (GPT-6.1 Sol)73.5 (GPT-6 Astra)30.9 (GPT-6 Luna)
Początkowy punkt odniesienia75.5 (Claude Opus 5)34.3 (Claude Sonnet 5)71.2 (Claude Fable)70.6 (GPT-6.1 Sol)77.5 (GPT-6 Astra)45.6 (GPT-6 Luna)

O benchmarku

Daj AI 150 prostopadłościanów. Poproś o taki efekt.

Okrągła głowa. Zaokrąglone krzesło. Maleńka lampka biurkowa. Jak wiernie model językowy może to odtworzyć, używając wyłącznie prostopadłościennych klocków?

Wzór: biały robot na zielonym krześle przy okrągłym biurku z monitorem, lampką, kubkiem i rośliną
Rzeźba do odtworzenia. 56 brył.
maksymalna liczba klocków
150
modele
6
próba na rundę
1

Jak to działa.

Niezmienny brief.

Każdy model otrzymuje ten sam pisemny brief z docelowymi wymiarami i kolorami. Pełny brief jest publicznie dostępny.

Tylko JSON.

Odpowiedź nie zawiera niczego więcej: maksymalnie 150 prostopadłościanów wraz z ich pozycjami, wymiarami i kolorami.

Jedna próba.

Średni poziom wysiłku rozumowania, bez narzędzi i bez powtórek. Rejestrujemy liczbę tokenów i czas wykonania.

Niezmienny algorytm oceny.

Stopień pokrycia objętości wzorca, ważony zgodnością kolorów, w skali od 0 do 100.

Wzór

procent pokrycia objętości × udział sześcianów o prawidłowym kolorze

Pomiar w jednostkach 1 cm³. Odcisk cyfrowy briefu 08fb5a5773fe89e7. Początkowy punkt odniesienia zachowuje oryginalne wyniki pierwszej rundy.

Pełna metodologia i pytania

Jak to działa

Opis zadania wymienia wszystkie bryły wzorca wraz z dokładnymi wartościami liczbowymi. Każdy model odpowiada wyłącznie w formacie JSON: podaje do 150 prostopadłościanów, a dla każdego położenie, rozmiar i jeden z 11 kolorów. Model sam niczego nie rysuje. Przy ocenie danego wykonania renderujemy jego prostopadłościany oraz wzorzec z takich samych małych sześcianów, przy tym samym oświetleniu i ustawieniu kamery, a następnie publikujemy obrazy.

Wynik to stopień pokrywania się objętości rzeźby i wzorca (stosunek części wspólnej do sumy zbiorów, mierzony w sześcianach o boku 1 cm) pomnożony przez udział sześcianów części wspólnej o prawidłowym kolorze. Jeden prostopadłościan na bryłę daje mniej niż 40 punktów; podzielenie każdej bryły na warstwy o równej grubości daje około 50 punktów. Nachylone nogi, cienkie kable i okrągłe głowy premiują modele, które planują położenie każdego prostopadłościanu, a widok Różnice pokazuje każdy brakujący, nadmiarowy i nieprawidłowo pokolorowany sześcian.

Uczciwe i powtarzalne warunki

Początkowy punkt odniesienia to oryginalna pierwsza runda, zachowana wraz z rzeczywistymi datami pomiarów. Na premierę poproszono o drugą rundę z pomiarami. Pokazujemy obie; żadnej nie przypisano wcześniejszej daty ani nie wybrano jako lepszego z dwóch wyników. Kolejne rundy odbywają się zgodnie z cotygodniowym harmonogramem.

  • Co tydzień to samo zadanie, ten sam program oceniający i te same ustawienia. Zadanie v3 ma odcisk cyfrowy 08fb5a5773fe89e7; każda zmiana oznacza nową wersję i nowy wykres.
  • Każdy model odpowiada raz przy średnim poziomie intensywności rozumowania, za pośrednictwem Claude Code lub Codex, po zalogowaniu na konto z subskrypcją, tak samo jak uruchamia je VibeiDE. Bez narzędzi, internetu, ponownych prób ani wybierania najlepszej z N odpowiedzi.
  • Modele uruchamiane są jeden po drugim, nigdy równolegle. Jeśli odpowiedź nie nadejdzie w ciągu 40 minut, wynik wynosi 0.
  • Ocenę wystawia deterministyczny program. Żaden model nie ocenia innego modelu.

Przeczytaj pełną treść zadania (zwykły tekst, 7,691 znaków). Nazwy modeli to aliasy dostępne w poszczególnych CLI; strona zapisuje identyfikator modelu zgłoszony przez CLI.

Pytania

Czy możliwości Claude lub GPT są ograniczane?

Ta strona nie daje wglądu w wewnętrzne działania dostawcy, ale pokazuje, czy model o tej samej nazwie z czasem uzyskuje inne wyniki w tym samym, niezmiennym zadaniu. Jedno uruchomienie tygodniowo to pojedyncza próba, więc zmianę o kilka punktów traktuj jako szum, a spadek utrzymujący się przez kilka tygodni jako sygnał.

Dlaczego żaden model nie może osiągnąć 100 punktów?

Wzorzec składa się z kul, elipsoid, walców i nachylonych kapsuł, a odpowiedź może zawierać tylko 150 prostopadłościanów o krawędziach równoległych do osi układu współrzędnych. Prostopadłościany nie mogą dokładnie odwzorować krzywizn, więc każda odpowiedź traci część objętości. Lepsze modele wykorzystują prostopadłościany tam, gdzie występują krzywizny, dzięki czemu ich rzeźby bardziej przypominają wzorzec.

Jak uruchamiane są modele?

Każdy model otrzymuje zadanie jeden raz za pośrednictwem swojego oficjalnego narzędzia wiersza poleceń, Claude Code lub Codex, po zalogowaniu w ramach zwykłej subskrypcji, ze średnim poziomem wysiłku rozumowania. Narzędzia, podagenci, dostęp do internetu i ponowne próby są wyłączone; przebieg, w którym model użyje narzędzia, otrzymuje 0 punktów. Odpowiedź ocenia deterministyczny program, a nie inny model.

Dlaczego benchmark przeszedł na v3?

W pierwszych dwóch wersjach modele miały zaprojektować układ biura. W pierwszych rundach najlepsze modele zdobyły 100 i 92 punkty, a każde poprawne biuro wyglądało tak samo. Benchmark, w którym najlepsze modele osiągają maksymalny wynik, nie pozwala pokazać postępu, a taki, w którym odpowiedzi wyglądają podobnie, nie pozwala pokazać jakości. Dlatego w v3 zadaniem jest stworzenie rzeźby, której jakość widać na pierwszy rzut oka.

Czy mogę samodzielnie wypróbować to zadanie?

Tak. Pełna treść zadania jest publicznie dostępna jako zwykły tekst. Wklej ją do dowolnego modelu i porównaj jego odpowiedź ze wzorcem.

Języki

Necessary cookies support sign-in, security, your language and this choice. Optional categories stay off until accepted.

First-party page views and acquisition measurement, plus Google Analytics 4 (Google Ireland, data may reach the US). Advertising personalization stays off.

With Analytics enabled, retain Google and Microsoft ad click identifiers and share download, signup, activation and purchase conversions with the relevant ad provider. No personalized advertising.

Remember referral credit for later. Links still work on the current page without this cookie.

Privacy · Cookie inventory