Office-vertailutesti
Mikä tekoäly rakentaa parhaiten?
Kuusi mallia. Yksi tehtävänanto. Yksi yritys kullekin. Pisteet 0–100 sen perusteella, kuinka tarkasti tulos vastaa tavoitetta.
Tulostaulukko.
Mitä kukin malli rakensi.
Muokkaamaton tulos, joka on renderöity kunkin mallin palauttamasta JSONista. Yksi yritys, ei uusintoja.
Kaikissa veistoksissa käytetään samaa valaistusta, kameraa ja mittakaavaa. Valitse mikä tahansa tulos verrataksesi sitä tavoitteeseen tai siirry Ero-näkymään tarkastelemaan poikkeamia.
Huomiot
Laatu, tokenit ja aika
Mitä kukin tulos vaati?
Vertaa valitun kierroksen pisteitä, raportoitujen syöte- ja tulostokenien yhteismäärää sekä suoritukseen kulunutta aikaa. Päättelytokeneita ei lisätä uudelleen. Puuttuvat mittaukset jätetään pois, eikä niitä lasketa nollaksi.
Katso tokenimäärien ja suoritusaikojen mittaukset
Mitatut tulokset
Kierros kierrokselta.
Lähtötaso säilyttää ensimmäisen kierroksen alkuperäiset tulokset ja mittauspäivämäärät. Seuraava piste on uusi mitattu kierros, ei toiselta viikolta peräisin oleva tulos.
Katso tallennetut pisteet
| Kierros | Claude Opus 5 / Claude Opus 5.5 | Claude Sonnet 5 / Claude Sonnet 5.5 | Claude Fable | GPT-6.1 Sol | GPT-6 Astra | GPT-6 Luna |
|---|---|---|---|---|---|---|
| 2026-W41 | 78.5 (Claude Opus 5.5) | 48.1 (Claude Sonnet 5.5) | 74.6 (Claude Fable) | 74.7 (GPT-6.1 Sol) | 73.5 (GPT-6 Astra) | 30.9 (GPT-6 Luna) |
| Lähtötaso | 75.5 (Claude Opus 5) | 34.3 (Claude Sonnet 5) | 71.2 (Claude Fable) | 70.6 (GPT-6.1 Sol) | 77.5 (GPT-6 Astra) | 45.6 (GPT-6 Luna) |
Tietoa vertailutestistä
Anna tekoälylle 150 laatikkoa. Pyydä sitä rakentamaan tämä.
Pyöreä pää. Kaareva tuoli. Pieni pöytälamppu. Kuinka lähelle kielimalli pääsee käyttämällä vain suorakulmaisia palikoita?
- laatikkoa enintään
- 150
- mallia
- 6
- yritys kierrosta kohden
- 1
Näin se toimii.
Lukittu tehtävänanto.
Jokainen malli saa saman kirjallisen tehtävänannon, jossa määritellään tavoitteen mitat ja värit. Koko tehtävänanto on julkinen.
Vain JSONia.
Vastaus sisältää vain enintään 150 laatikkoa sijainteineen, kokoineen ja väreineen.
Yksi yritys.
Keskitasoinen päättelypanos, ei työkaluja eikä uusintoja. Tokenien määrää ja suoritusaikaa seurataan.
Lukittu pisteytys.
Tilavuuksien päällekkäisyys tavoitteen kanssa, painotettuna värien tarkkuudella, asteikolla 0–100.
Kaava
tilavuuksien päällekkäisyys % × oikeanväristen kuutioiden osuusMitataan 1 cm³:n yksiköissä. Tehtävänannon sormenjälki 08fb5a5773fe89e7. Lähtötaso säilyttää ensimmäisen kierroksen alkuperäiset tulokset.
Koko menetelmäkuvaus ja kysymykset
Näin se toimii
Tehtävänannossa luetellaan mallikuvan jokainen muoto tarkkoine lukuarvoineen. Kukin malli vastaa pelkässä JSON-muodossa: enintään 150 laatikkoa, joista jokaiselle määritetään sijainti, koko ja yksi 11 väristä. Malli ei itse piirrä mitään. Kun suoritus pisteytetään, renderöimme sen laatikot ja mallikuvan samoista pienistä kuutioista samalla valaistuksella ja kameralla ja julkaisemme kuvat.
Pistemäärä saadaan kertomalla veistoksen ja tavoitemallin tilavuuksien päällekkäisyys oikein väritettyjen yhteisten kuutioiden osuudella. Päällekkäisyys lasketaan leikkauksen ja yhdisteen suhteena 1 cm:n kuutioilla mitattuna. Yksi laatikko kutakin muotoa kohti tuottaa alle 40 pistettä. Jokaisen muodon jakaminen yhtä paksuihin viipaleisiin tuottaa noin 50 pistettä. Vinot jalat, ohuet kaapelit ja pyöreät päät palkitsevat malleja, jotka suunnittelevat jokaisen laatikon sijainnin. Erot-näkymä näyttää kaikki puuttuvat, ylimääräiset ja vääränväriset kuutiot.
Tasapuolinen ja toistettava
Lähtötasona on alkuperäinen ensimmäinen kierros, jonka todelliset mittauspäivämäärät on säilytetty. Julkaisua varten pyydettiin toinen mitattu kierros. Molemmat näytetään; kummankaan päivämäärää ei ole siirretty aiemmaksi eikä kumpaakaan ole valittu kahdesta parhaaksi tulokseksi. Myöhemmät kierrokset noudattavat viikoittaista aikataulua.
- Sama tehtävänanto, sama pisteytysohjelma ja samat asetukset joka viikko. Tehtävänannon v3 sormenjälki on
08fb5a5773fe89e7. Jokainen muutos aloittaa uuden version ja uuden kaavion. - Jokainen malli vastaa kerran päättelyn keskitasolla Claude Coden tai Codexin kautta. Työkaluun kirjaudutaan tilauksella samalla tavalla kuin VibeiDE käyttää niitä. Ei työkaluja, verkkoyhteyttä, uudelleenyrityksiä eikä parhaan vastauksen valintaa N yrityksestä.
- Mallit ajetaan peräkkäin, ei koskaan rinnakkain. Jos vastausta ei saada 40 minuutin kuluessa, tulos on 0 pistettä.
- Pisteytysohjelma on deterministinen. Mikään malli ei arvioi toista mallia.
Lue koko tehtävänanto (pelkkää tekstiä, 7,691 merkkiä). Mallien nimet ovat kunkin komentorivityökalun tarjoamia aliaksia. Sivulle tallennetaan komentorivityökalun ilmoittama mallitunniste.
Kysymyksiä
Heikennetäänkö Clauden tai GPT:n suorituskykyä?
Tämä sivu ei näe palveluntarjoajan sisäiseen toimintaan, mutta se näyttää, saako samalla nimellä toimiva malli ajan myötä eri pisteitä samasta muuttumattomasta tehtävästä. Yksi suoritus viikossa on vain yksittäinen havainto, joten pidä muutaman pisteen muutosta kohinana ja useita viikkoja jatkuvaa laskua merkkinä muutoksesta.
Miksi mikään malli ei voi saada 100 pistettä?
Tavoitemalli koostuu palloista, ellipsoideista, lieriöistä ja vinoista kapselimuodoista, mutta vastauksessa saa käyttää vain 150 koordinaattiakselien suuntaista laatikkoa. Laatikot eivät pysty seuraamaan kaarevia pintoja täsmälleen, joten jokaisessa vastauksessa osa tilavuudesta jää puuttumaan. Paremmat mallit kohdentavat laatikkonsa kaareviin kohtiin, jolloin niiden veistokset muistuttavat tavoitemallia enemmän.
Miten malleja ajetaan?
Jokainen malli saa tehtävänannon kerran virallisen komentorivityökalunsa, Claude Coden tai Codexin, kautta tavallisella tilauksella kirjautuneena ja keskitason päättelypanoksella. Työkalut, aliagentit, verkkoyhteys ja uusintayritykset on poistettu käytöstä. Työkalua käyttävä suoritus saa 0 pistettä. Vastauksen pisteyttää deterministinen ohjelma, ei toinen malli.
Miksi vertailutesti vaihtui versioon v3?
Kahdessa ensimmäisessä versiossa malleja pyydettiin suunnittelemaan toimiston pohjaratkaisu. Niiden ensimmäisillä kierroksilla parhaat mallit saivat 100 ja 92 pistettä, ja kaikki oikein toteutetut toimistot näyttivät samalta. Vertailutesti, jossa huippumallit saavuttavat enimmäispisteet, ei voi näyttää kehitystä. Jos vastaukset näyttävät samanlaisilta, testi ei myöskään tuo laatua esiin. Siksi v3 pyytää veistosta, jonka laadun näkee yhdellä silmäyksellä.
Voinko kokeilla tehtävänantoa itse?
Kyllä. Koko tehtävänanto on julkisesti saatavilla pelkkänä tekstinä. Liitä se mille tahansa mallille ja vertaa vastausta tavoitemalliin.