Benchmark biurowy
Które AI buduje najlepiej?
Sześć modeli. Jeden brief. Po jednej próbie. Ocena od 0 do 100 za zgodność z dokładnym wzorcem.
Ranking.
Co zbudował każdy model.
Surowe wyniki, wyrenderowane z JSON zwróconego przez każdy model. Jedna próba, bez powtórek.
Każda rzeźba jest prezentowana przy takim samym oświetleniu, ustawieniu kamery i w tej samej skali. Wybierz dowolny wynik, aby porównać go ze wzorem, lub przełącz na widok różnic, aby przyjrzeć się rozbieżnościom.
Uwagi
Jakość, tokeny i czas
Ile zasobów wymagało uzyskanie każdego wyniku?
Porównaj ocenę, raportowaną sumę tokenów wejściowych i wyjściowych oraz czas wykonania dla wybranej rundy. Tokeny rozumowania nie są doliczane ponownie. Brakujące pomiary są pomijane, a nie traktowane jako zero.
Zobacz pomiary liczby tokenów i czasu wykonania
Wyniki pomiarów
Runda po rundzie.
Początkowy punkt odniesienia zachowuje oryginalne wyniki pierwszej rundy i daty pomiarów. Kolejny punkt to nowa runda z pomiarami, a nie wynik z innego tygodnia.
Zobacz zapisane oceny
| Runda | Claude Opus 5 / Claude Opus 5.5 | Claude Sonnet 5 / Claude Sonnet 5.5 | Claude Fable | GPT-6.1 Sol | GPT-6 Astra | GPT-6 Luna |
|---|---|---|---|---|---|---|
| 2026-W41 | 78.5 (Claude Opus 5.5) | 48.1 (Claude Sonnet 5.5) | 74.6 (Claude Fable) | 74.7 (GPT-6.1 Sol) | 73.5 (GPT-6 Astra) | 30.9 (GPT-6 Luna) |
| Początkowy punkt odniesienia | 75.5 (Claude Opus 5) | 34.3 (Claude Sonnet 5) | 71.2 (Claude Fable) | 70.6 (GPT-6.1 Sol) | 77.5 (GPT-6 Astra) | 45.6 (GPT-6 Luna) |
O benchmarku
Daj AI 150 prostopadłościanów. Poproś o taki efekt.
Okrągła głowa. Zaokrąglone krzesło. Maleńka lampka biurkowa. Jak wiernie model językowy może to odtworzyć, używając wyłącznie prostopadłościennych klocków?
- maksymalna liczba klocków
- 150
- modele
- 6
- próba na rundę
- 1
Jak to działa.
Niezmienny brief.
Każdy model otrzymuje ten sam pisemny brief z docelowymi wymiarami i kolorami. Pełny brief jest publicznie dostępny.
Tylko JSON.
Odpowiedź nie zawiera niczego więcej: maksymalnie 150 prostopadłościanów wraz z ich pozycjami, wymiarami i kolorami.
Jedna próba.
Średni poziom wysiłku rozumowania, bez narzędzi i bez powtórek. Rejestrujemy liczbę tokenów i czas wykonania.
Niezmienny algorytm oceny.
Stopień pokrycia objętości wzorca, ważony zgodnością kolorów, w skali od 0 do 100.
Wzór
procent pokrycia objętości × udział sześcianów o prawidłowym kolorzePomiar w jednostkach 1 cm³. Odcisk cyfrowy briefu 08fb5a5773fe89e7. Początkowy punkt odniesienia zachowuje oryginalne wyniki pierwszej rundy.
Pełna metodologia i pytania
Jak to działa
Opis zadania wymienia wszystkie bryły wzorca wraz z dokładnymi wartościami liczbowymi. Każdy model odpowiada wyłącznie w formacie JSON: podaje do 150 prostopadłościanów, a dla każdego położenie, rozmiar i jeden z 11 kolorów. Model sam niczego nie rysuje. Przy ocenie danego wykonania renderujemy jego prostopadłościany oraz wzorzec z takich samych małych sześcianów, przy tym samym oświetleniu i ustawieniu kamery, a następnie publikujemy obrazy.
Wynik to stopień pokrywania się objętości rzeźby i wzorca (stosunek części wspólnej do sumy zbiorów, mierzony w sześcianach o boku 1 cm) pomnożony przez udział sześcianów części wspólnej o prawidłowym kolorze. Jeden prostopadłościan na bryłę daje mniej niż 40 punktów; podzielenie każdej bryły na warstwy o równej grubości daje około 50 punktów. Nachylone nogi, cienkie kable i okrągłe głowy premiują modele, które planują położenie każdego prostopadłościanu, a widok Różnice pokazuje każdy brakujący, nadmiarowy i nieprawidłowo pokolorowany sześcian.
Uczciwe i powtarzalne warunki
Początkowy punkt odniesienia to oryginalna pierwsza runda, zachowana wraz z rzeczywistymi datami pomiarów. Na premierę poproszono o drugą rundę z pomiarami. Pokazujemy obie; żadnej nie przypisano wcześniejszej daty ani nie wybrano jako lepszego z dwóch wyników. Kolejne rundy odbywają się zgodnie z cotygodniowym harmonogramem.
- Co tydzień to samo zadanie, ten sam program oceniający i te same ustawienia. Zadanie v3 ma odcisk cyfrowy
08fb5a5773fe89e7; każda zmiana oznacza nową wersję i nowy wykres. - Każdy model odpowiada raz przy średnim poziomie intensywności rozumowania, za pośrednictwem Claude Code lub Codex, po zalogowaniu na konto z subskrypcją, tak samo jak uruchamia je VibeiDE. Bez narzędzi, internetu, ponownych prób ani wybierania najlepszej z N odpowiedzi.
- Modele uruchamiane są jeden po drugim, nigdy równolegle. Jeśli odpowiedź nie nadejdzie w ciągu 40 minut, wynik wynosi 0.
- Ocenę wystawia deterministyczny program. Żaden model nie ocenia innego modelu.
Przeczytaj pełną treść zadania (zwykły tekst, 7,691 znaków). Nazwy modeli to aliasy dostępne w poszczególnych CLI; strona zapisuje identyfikator modelu zgłoszony przez CLI.
Pytania
Czy możliwości Claude lub GPT są ograniczane?
Ta strona nie daje wglądu w wewnętrzne działania dostawcy, ale pokazuje, czy model o tej samej nazwie z czasem uzyskuje inne wyniki w tym samym, niezmiennym zadaniu. Jedno uruchomienie tygodniowo to pojedyncza próba, więc zmianę o kilka punktów traktuj jako szum, a spadek utrzymujący się przez kilka tygodni jako sygnał.
Dlaczego żaden model nie może osiągnąć 100 punktów?
Wzorzec składa się z kul, elipsoid, walców i nachylonych kapsuł, a odpowiedź może zawierać tylko 150 prostopadłościanów o krawędziach równoległych do osi układu współrzędnych. Prostopadłościany nie mogą dokładnie odwzorować krzywizn, więc każda odpowiedź traci część objętości. Lepsze modele wykorzystują prostopadłościany tam, gdzie występują krzywizny, dzięki czemu ich rzeźby bardziej przypominają wzorzec.
Jak uruchamiane są modele?
Każdy model otrzymuje zadanie jeden raz za pośrednictwem swojego oficjalnego narzędzia wiersza poleceń, Claude Code lub Codex, po zalogowaniu w ramach zwykłej subskrypcji, ze średnim poziomem wysiłku rozumowania. Narzędzia, podagenci, dostęp do internetu i ponowne próby są wyłączone; przebieg, w którym model użyje narzędzia, otrzymuje 0 punktów. Odpowiedź ocenia deterministyczny program, a nie inny model.
Dlaczego benchmark przeszedł na v3?
W pierwszych dwóch wersjach modele miały zaprojektować układ biura. W pierwszych rundach najlepsze modele zdobyły 100 i 92 punkty, a każde poprawne biuro wyglądało tak samo. Benchmark, w którym najlepsze modele osiągają maksymalny wynik, nie pozwala pokazać postępu, a taki, w którym odpowiedzi wyglądają podobnie, nie pozwala pokazać jakości. Dlatego w v3 zadaniem jest stworzenie rzeźby, której jakość widać na pierwszy rzut oka.
Czy mogę samodzielnie wypróbować to zadanie?
Tak. Pełna treść zadania jest publicznie dostępna jako zwykły tekst. Wklej ją do dowolnego modelu i porównaj jego odpowiedź ze wzorcem.