Bulegoko errendimendu-proba
Zein AAk eraikitzen du ondoen?
Sei modelo. Zehaztapen bakarra. Saiakera bana. 0tik 100era puntuatuta, helburu zehatzarekin alderatuta.
Sailkapena.
Modelo bakoitzak eraiki duena.
Irteera gordina, modelo bakoitzak itzulitako JSONetik errendatua. Saiakera bakarra, errepikapenik gabe.
Eskultura guztiek argi, kamera eta eskala berberak erabiltzen dituzte. Hautatu edozein emaitza helburuarekin alderatzeko, edo aldatu Aldea ikuspegira bat ez datozen xehetasunak aztertzeko.
Oharrak
Kalitatea, tokenak eta denbora
Zer behar izan zen emaitza bakoitza lortzeko?
Konparatu hautatutako saioaren puntuazioa, jakinarazitako sarrera- eta irteera-tokenen batura eta exekuzio-denbora. Arrazoiketa-tokenak ez dira berriro gehitzen. Falta diren neurketak kanpoan uzten dira, ez dira zerotzat hartzen.
Ikusi tokenen eta exekuzio-denboraren neurketak
Neurtutako emaitzak
Txandaz txanda.
Hasierako erreferentziak lehen saioaren jatorrizko emaitzak eta neurketa-datak gordetzen ditu. Hurrengo puntua neurtutako saio berri bati dagokio, ez beste aste bateko emaitza bati.
Ikusi erregistratutako puntuazioak
| Saioa | Claude Opus 5 / Claude Opus 5.5 | Claude Sonnet 5 / Claude Sonnet 5.5 | Claude Fable | GPT-6.1 Sol | GPT-6 Astra | GPT-6 Luna |
|---|---|---|---|---|---|---|
| 2026-W41 | 78.5 (Claude Opus 5.5) | 48.1 (Claude Sonnet 5.5) | 74.6 (Claude Fable) | 74.7 (GPT-6.1 Sol) | 73.5 (GPT-6 Astra) | 30.9 (GPT-6 Luna) |
| Hasierako erreferentzia | 75.5 (Claude Opus 5) | 34.3 (Claude Sonnet 5) | 71.2 (Claude Fable) | 70.6 (GPT-6.1 Sol) | 77.5 (GPT-6 Astra) | 45.6 (GPT-6 Luna) |
Errendimendu-probari buruz
Eman AA bati 150 kutxa. Eskatu hau egiteko.
Buru biribil bat. Aulki kurbatu bat. Mahaiko lanpara txiki bat. Zenbateraino hurbil daiteke hizkuntza-eredu bat bloke angeluzuzenak soilik erabilita?
- kutxa gehienez
- 150
- eredu
- 6
- saio bakoitzeko saiakera
- 1
Nola funtzionatzen duen.
Zehaztapen finkoa.
Modelo guztiek idatzizko zehaztapen bera jasotzen dute, helburuaren neurri eta koloreekin. Zehaztapen osoa publikoa da.
JSON soilik.
Erantzunak ez du besterik: gehienez 150 kutxa, bakoitzaren posizio, neurri eta koloreekin.
Saiakera bakarra.
Arrazoitzeko ahalegin ertaina, tresnarik eta errepikapenik gabe. Tokenak eta exekuzio-denbora erregistratzen dira.
Puntuazio-sistema finkoa.
Helburuarekiko bolumen-gainjartzea, koloreen zehaztasunaren arabera haztatuta, 0tik 100era.
Formula
bolumen-gainjartzearen % × kolore zuzena duten kuboen proportzioa1 cm³-ko unitatetan neurtua. Zehaztapenaren hatz-marka: 08fb5a5773fe89e7. Hasierako erreferentziak lehen txandako jatorrizko emaitzak gordetzen ditu.
Metodologia osoa eta galderak
Nola funtzionatzen duen
Enkarguak erreferentziaren forma guztiak zerrendatzen ditu, zenbaki zehatzekin. Modelo bakoitzak JSON hutsez erantzuten du: gehienez 150 kutxa, bakoitza bere kokapenarekin, neurriekin eta 11 koloreetako batekin. Modeloak berak ez du ezer marrazten. Exekuzio bati puntuazioa ematean, haren kutxak eta erreferentzia kubo txiki berberekin errenderatzen ditugu, argiztapen eta kamera berberak erabiliz, eta irudiak argitaratzen ditugu.
Puntuazioa eskulturaren eta erreferentziaren arteko bolumen-gainjartzearen emaitza da (ebakidura zati bildura, 1 cm-ko kuboetan neurtuta), bietan dauden kuboen artean kolore zuzena dutenen proportzioaz biderkatuta. Forma bakoitzeko kutxa bat erabiliz, 40 puntu baino gutxiago lortzen dira; forma bakoitza lodiera bereko xafletan zatituz, 50 puntu inguru. Hanka inklinatuek, kable meheek eta buru biribilek kutxa bakoitza non kokatu planifikatzen duten modeloak saritzen dituzte, eta Aldea ikuspegiak falta diren, soberan dauden eta kolore okerra duten kubo guztiak erakusten ditu.
Bidezkoa eta errepikagarria
Hasierako erreferentzia jatorrizko lehen saioa da, benetako neurketa-datekin gordeta. Abiarazterako neurtutako bigarren saio bat eskatu zen. Biak erakusten dira; ez zaio bati ere atzeragoko datarik esleitzen, eta ez da bietako onena hautatzen emaitza gisa. Ondorengo saioek asteko egutegiari jarraitzen diote.
- Zereginaren deskribapen bera, puntuazioa kalkulatzeko programa bera eta ezarpen berak astero. Zereginaren deskribapenaren v3 bertsioak
08fb5a5773fe89e7hatz-marka du; edozein aldaketak bertsio berri bat eta grafiko berri bat abiarazten ditu. - Eredu bakoitzak behin erantzuten du arrazoitzeko ahalegin ertainean, harpidetza batekin saioa hasita duen Claude Code edo Codex bidez, VibeiDEk exekutatzen dituen modu berean. Tresnarik ez, webik ez, berriro saiatzerik ez, N erantzunen artean onena hautatzerik ez.
- Ereduak bata bestearen ondoren exekutatzen dira, inoiz ez paraleloan. 40 minutuan iristen ez den erantzunak 0 puntu jasotzen ditu.
- Puntuazio-programa determinista da. Eredu batek ere ez du beste eredu bat ebaluatzen.
Irakurri zereginaren deskribapen osoa (testu arrunta, 7,691 karaktere). Modeloen izenak CLI bakoitzak eskaintzen dituen aliasak dira; orriak CLIak jakinarazitako modelo-identifikatzailea erregistratzen du.
Galderak
Claude edo GPT ahultzen ari dira?
Orrialde honek ezin du hornitzaile baten barruan zer gertatzen den ikusi, baina erakusten du ea izen bereko ereduak puntuazio desberdinak lortzen dituen denboran zehar ataza finko berean. Asteko exekuzio bakarra lagin bakarra da; beraz, hartu puntu gutxiko aldaketa zaratatzat, eta hainbat astez irauten duen beherakada seinaletzat.
Zergatik ezin du modelo batek ere 100 lortu?
Erreferentzia esferez, elipsoidez, zilindroz eta kapsula inklinatuz osatuta dago, eta erantzunean ardatzekin lerrokatutako 150 kutxa soilik erabil daitezke. Kutxek ezin dituzte kurbak zehatz jarraitu; beraz, erantzun guztiek bolumen pixka bat galtzen dute. Modelo hobeek kurbak dauden tokietan erabiltzen dituzte kutxak, eta haien eskulturek antz handiagoa dute erreferentziarekin.
Nola exekutatzen dira ereduak?
Modelo bakoitzak behin jasotzen du zereginaren deskribapena bere komando-lerroko tresna ofizialaren bidez, Claude Code edo Codex erabiliz, ohiko harpidetza batekin saioa hasita eta arrazoiketa-ahalegin ertainarekin. Tresnak, azpiagenteak, weberako sarbidea eta berriz saiatzea desgaituta daude; tresna bat erabiltzen duen exekuzioak 0 puntu jasotzen ditu. Programa determinista batek ematen dio puntuazioa erantzunari, ez beste modelo batek.
Zergatik aldatu zen errendimendu-proba v3 bertsiora?
Lehen bi bertsioetan, bulego bat antolatzeko eskatu zitzaien modeloei. Lehen txandetan, modelo onenek 100 eta 92 puntu lortu zituzten, eta zuzen egindako bulego guztiek itxura bera zuten. Modelo onenek puntuazio gorena lortzen duten proba batek ezin du bilakaera erakutsi, eta erantzun guztiek antzeko itxura duten proba batek ezin du kalitatea erakutsi. Horregatik, v3 bertsioak begiratu batean kalitatea antzemateko moduko eskultura bat eskatzen du.
Neuk proba dezaket ataza-deskribapena?
Bai. Zereginaren deskribapen osoa publikoki eskuragarri dago testu arruntean. Itsatsi edozein modelotan eta alderatu haren erantzuna erreferentziarekin.