Office-vertailutesti

Mikä tekoäly rakentaa parhaiten?

Kuusi mallia. Yksi tehtävänanto. Yksi yritys kullekin. Pisteet 0–100 sen perusteella, kuinka tarkasti tulos vastaa tavoitetta.

Tulostaulukko.

Mitä kukin malli rakensi.

Muokkaamaton tulos, joka on renderöity kunkin mallin palauttamasta JSONista. Yksi yritys, ei uusintoja.

Viikko 2026-W41

Kaikissa veistoksissa käytetään samaa valaistusta, kameraa ja mittakaavaa. Valitse mikä tahansa tulos verrataksesi sitä tavoitteeseen tai siirry Ero-näkymään tarkastelemaan poikkeamia.

  1. Claude Opus 5.578.5/100Claude Opus 5.5in veistos
  2. GPT-6.1 Sol74.7/100GPT-6.1 Solin veistos
  3. Claude Fable74.6/100Claude Fablen veistos
  4. GPT-6 Astra73.5/100GPT-6 Astran veistos
  5. Claude Sonnet 5.548.1/100Claude Sonnet 5.5in veistos
  6. GPT-6 Luna30.9/100GPT-6 Lunan veistos

Laatu, tokenit ja aika

Mitä kukin tulos vaati?

Vertaa valitun kierroksen pisteitä, raportoitujen syöte- ja tulostokenien yhteismäärää sekä suoritukseen kulunutta aikaa. Päättelytokeneita ei lisätä uudelleen. Puuttuvat mittaukset jätetään pois, eikä niitä lasketa nollaksi.

Katso tokenimäärien ja suoritusaikojen mittaukset

Mitatut tulokset

Kierros kierrokselta.

Lähtötaso säilyttää ensimmäisen kierroksen alkuperäiset tulokset ja mittauspäivämäärät. Seuraava piste on uusi mitattu kierros, ei toiselta viikolta peräisin oleva tulos.

Katso tallennetut pisteet
Kierroskohtaiset pisteet asteikolla 0–100
KierrosClaude Opus 5 / Claude Opus 5.5Claude Sonnet 5 / Claude Sonnet 5.5Claude FableGPT-6.1 SolGPT-6 AstraGPT-6 Luna
2026-W4178.5 (Claude Opus 5.5)48.1 (Claude Sonnet 5.5)74.6 (Claude Fable)74.7 (GPT-6.1 Sol)73.5 (GPT-6 Astra)30.9 (GPT-6 Luna)
Lähtötaso75.5 (Claude Opus 5)34.3 (Claude Sonnet 5)71.2 (Claude Fable)70.6 (GPT-6.1 Sol)77.5 (GPT-6 Astra)45.6 (GPT-6 Luna)

Tietoa vertailutestistä

Anna tekoälylle 150 laatikkoa. Pyydä sitä rakentamaan tämä.

Pyöreä pää. Kaareva tuoli. Pieni pöytälamppu. Kuinka lähelle kielimalli pääsee käyttämällä vain suorakulmaisia palikoita?

Tavoite: valkoinen robotti vihreällä tuolilla pyöreän pöydän ääressä, pöydällä näyttö, lamppu, muki ja kasvi
Jäljennettävä veistos. 56 muotoa.
laatikkoa enintään
150
mallia
6
yritys kierrosta kohden
1

Näin se toimii.

Lukittu tehtävänanto.

Jokainen malli saa saman kirjallisen tehtävänannon, jossa määritellään tavoitteen mitat ja värit. Koko tehtävänanto on julkinen.

Vain JSONia.

Vastaus sisältää vain enintään 150 laatikkoa sijainteineen, kokoineen ja väreineen.

Yksi yritys.

Keskitasoinen päättelypanos, ei työkaluja eikä uusintoja. Tokenien määrää ja suoritusaikaa seurataan.

Lukittu pisteytys.

Tilavuuksien päällekkäisyys tavoitteen kanssa, painotettuna värien tarkkuudella, asteikolla 0–100.

Kaava

tilavuuksien päällekkäisyys % × oikeanväristen kuutioiden osuus

Mitataan 1 cm³:n yksiköissä. Tehtävänannon sormenjälki 08fb5a5773fe89e7. Lähtötaso säilyttää ensimmäisen kierroksen alkuperäiset tulokset.

Koko menetelmäkuvaus ja kysymykset

Näin se toimii

Tehtävänannossa luetellaan mallikuvan jokainen muoto tarkkoine lukuarvoineen. Kukin malli vastaa pelkässä JSON-muodossa: enintään 150 laatikkoa, joista jokaiselle määritetään sijainti, koko ja yksi 11 väristä. Malli ei itse piirrä mitään. Kun suoritus pisteytetään, renderöimme sen laatikot ja mallikuvan samoista pienistä kuutioista samalla valaistuksella ja kameralla ja julkaisemme kuvat.

Pistemäärä saadaan kertomalla veistoksen ja tavoitemallin tilavuuksien päällekkäisyys oikein väritettyjen yhteisten kuutioiden osuudella. Päällekkäisyys lasketaan leikkauksen ja yhdisteen suhteena 1 cm:n kuutioilla mitattuna. Yksi laatikko kutakin muotoa kohti tuottaa alle 40 pistettä. Jokaisen muodon jakaminen yhtä paksuihin viipaleisiin tuottaa noin 50 pistettä. Vinot jalat, ohuet kaapelit ja pyöreät päät palkitsevat malleja, jotka suunnittelevat jokaisen laatikon sijainnin. Erot-näkymä näyttää kaikki puuttuvat, ylimääräiset ja vääränväriset kuutiot.

Tasapuolinen ja toistettava

Lähtötasona on alkuperäinen ensimmäinen kierros, jonka todelliset mittauspäivämäärät on säilytetty. Julkaisua varten pyydettiin toinen mitattu kierros. Molemmat näytetään; kummankaan päivämäärää ei ole siirretty aiemmaksi eikä kumpaakaan ole valittu kahdesta parhaaksi tulokseksi. Myöhemmät kierrokset noudattavat viikoittaista aikataulua.

  • Sama tehtävänanto, sama pisteytysohjelma ja samat asetukset joka viikko. Tehtävänannon v3 sormenjälki on 08fb5a5773fe89e7. Jokainen muutos aloittaa uuden version ja uuden kaavion.
  • Jokainen malli vastaa kerran päättelyn keskitasolla Claude Coden tai Codexin kautta. Työkaluun kirjaudutaan tilauksella samalla tavalla kuin VibeiDE käyttää niitä. Ei työkaluja, verkkoyhteyttä, uudelleenyrityksiä eikä parhaan vastauksen valintaa N yrityksestä.
  • Mallit ajetaan peräkkäin, ei koskaan rinnakkain. Jos vastausta ei saada 40 minuutin kuluessa, tulos on 0 pistettä.
  • Pisteytysohjelma on deterministinen. Mikään malli ei arvioi toista mallia.

Lue koko tehtävänanto (pelkkää tekstiä, 7,691 merkkiä). Mallien nimet ovat kunkin komentorivityökalun tarjoamia aliaksia. Sivulle tallennetaan komentorivityökalun ilmoittama mallitunniste.

Kysymyksiä

Heikennetäänkö Clauden tai GPT:n suorituskykyä?

Tämä sivu ei näe palveluntarjoajan sisäiseen toimintaan, mutta se näyttää, saako samalla nimellä toimiva malli ajan myötä eri pisteitä samasta muuttumattomasta tehtävästä. Yksi suoritus viikossa on vain yksittäinen havainto, joten pidä muutaman pisteen muutosta kohinana ja useita viikkoja jatkuvaa laskua merkkinä muutoksesta.

Miksi mikään malli ei voi saada 100 pistettä?

Tavoitemalli koostuu palloista, ellipsoideista, lieriöistä ja vinoista kapselimuodoista, mutta vastauksessa saa käyttää vain 150 koordinaattiakselien suuntaista laatikkoa. Laatikot eivät pysty seuraamaan kaarevia pintoja täsmälleen, joten jokaisessa vastauksessa osa tilavuudesta jää puuttumaan. Paremmat mallit kohdentavat laatikkonsa kaareviin kohtiin, jolloin niiden veistokset muistuttavat tavoitemallia enemmän.

Miten malleja ajetaan?

Jokainen malli saa tehtävänannon kerran virallisen komentorivityökalunsa, Claude Coden tai Codexin, kautta tavallisella tilauksella kirjautuneena ja keskitason päättelypanoksella. Työkalut, aliagentit, verkkoyhteys ja uusintayritykset on poistettu käytöstä. Työkalua käyttävä suoritus saa 0 pistettä. Vastauksen pisteyttää deterministinen ohjelma, ei toinen malli.

Miksi vertailutesti vaihtui versioon v3?

Kahdessa ensimmäisessä versiossa malleja pyydettiin suunnittelemaan toimiston pohjaratkaisu. Niiden ensimmäisillä kierroksilla parhaat mallit saivat 100 ja 92 pistettä, ja kaikki oikein toteutetut toimistot näyttivät samalta. Vertailutesti, jossa huippumallit saavuttavat enimmäispisteet, ei voi näyttää kehitystä. Jos vastaukset näyttävät samanlaisilta, testi ei myöskään tuo laatua esiin. Siksi v3 pyytää veistosta, jonka laadun näkee yhdellä silmäyksellä.

Voinko kokeilla tehtävänantoa itse?

Kyllä. Koko tehtävänanto on julkisesti saatavilla pelkkänä tekstinä. Liitä se mille tahansa mallille ja vertaa vastausta tavoitemalliin.

Kielet

Necessary cookies support sign-in, security, your language and this choice. Optional categories stay off until accepted.

First-party page views and acquisition measurement, plus Google Analytics 4 (Google Ireland, data may reach the US). Advertising personalization stays off.

With Analytics enabled, retain Google and Microsoft ad click identifiers and share download, signup, activation and purchase conversions with the relevant ad provider. No personalized advertising.

Remember referral credit for later. Links still work on the current page without this cookie.

Privacy · Cookie inventory