Bulegoko errendimendu-proba

Zein AAk eraikitzen du ondoen?

Sei modelo. Zehaztapen bakarra. Saiakera bana. 0tik 100era puntuatuta, helburu zehatzarekin alderatuta.

Sailkapena.

Modelo bakoitzak eraiki duena.

Irteera gordina, modelo bakoitzak itzulitako JSONetik errendatua. Saiakera bakarra, errepikapenik gabe.

2026-W41 astea

Eskultura guztiek argi, kamera eta eskala berberak erabiltzen dituzte. Hautatu edozein emaitza helburuarekin alderatzeko, edo aldatu Aldea ikuspegira bat ez datozen xehetasunak aztertzeko.

  1. Claude Opus 5.578.5/100Claude Opus 5.5 modeloaren eskultura
  2. GPT-6.1 Sol74.7/100GPT-6.1 Sol modeloaren eskultura
  3. Claude Fable74.6/100Claude Fable modeloaren eskultura
  4. GPT-6 Astra73.5/100GPT-6 Astra modeloaren eskultura
  5. Claude Sonnet 5.548.1/100Claude Sonnet 5.5 modeloaren eskultura
  6. GPT-6 Luna30.9/100GPT-6 Luna modeloaren eskultura

Kalitatea, tokenak eta denbora

Zer behar izan zen emaitza bakoitza lortzeko?

Konparatu hautatutako saioaren puntuazioa, jakinarazitako sarrera- eta irteera-tokenen batura eta exekuzio-denbora. Arrazoiketa-tokenak ez dira berriro gehitzen. Falta diren neurketak kanpoan uzten dira, ez dira zerotzat hartzen.

Ikusi tokenen eta exekuzio-denboraren neurketak

Neurtutako emaitzak

Txandaz txanda.

Hasierako erreferentziak lehen saioaren jatorrizko emaitzak eta neurketa-datak gordetzen ditu. Hurrengo puntua neurtutako saio berri bati dagokio, ez beste aste bateko emaitza bati.

Ikusi erregistratutako puntuazioak
Saio bakoitzeko puntuazioa, 100etik
SaioaClaude Opus 5 / Claude Opus 5.5Claude Sonnet 5 / Claude Sonnet 5.5Claude FableGPT-6.1 SolGPT-6 AstraGPT-6 Luna
2026-W4178.5 (Claude Opus 5.5)48.1 (Claude Sonnet 5.5)74.6 (Claude Fable)74.7 (GPT-6.1 Sol)73.5 (GPT-6 Astra)30.9 (GPT-6 Luna)
Hasierako erreferentzia75.5 (Claude Opus 5)34.3 (Claude Sonnet 5)71.2 (Claude Fable)70.6 (GPT-6.1 Sol)77.5 (GPT-6 Astra)45.6 (GPT-6 Luna)

Errendimendu-probari buruz

Eman AA bati 150 kutxa. Eskatu hau egiteko.

Buru biribil bat. Aulki kurbatu bat. Mahaiko lanpara txiki bat. Zenbateraino hurbil daiteke hizkuntza-eredu bat bloke angeluzuzenak soilik erabilita?

Helburua: robot zuri bat aulki berde batean eserita, mahai biribil baten aurrean; mahai gainean monitore bat, lanpara bat, katilu bat eta landare bat daude
Birsortu beharreko eskultura. 56 forma.
kutxa gehienez
150
eredu
6
saio bakoitzeko saiakera
1

Nola funtzionatzen duen.

Zehaztapen finkoa.

Modelo guztiek idatzizko zehaztapen bera jasotzen dute, helburuaren neurri eta koloreekin. Zehaztapen osoa publikoa da.

JSON soilik.

Erantzunak ez du besterik: gehienez 150 kutxa, bakoitzaren posizio, neurri eta koloreekin.

Saiakera bakarra.

Arrazoitzeko ahalegin ertaina, tresnarik eta errepikapenik gabe. Tokenak eta exekuzio-denbora erregistratzen dira.

Puntuazio-sistema finkoa.

Helburuarekiko bolumen-gainjartzea, koloreen zehaztasunaren arabera haztatuta, 0tik 100era.

Formula

bolumen-gainjartzearen % × kolore zuzena duten kuboen proportzioa

1 cm³-ko unitatetan neurtua. Zehaztapenaren hatz-marka: 08fb5a5773fe89e7. Hasierako erreferentziak lehen txandako jatorrizko emaitzak gordetzen ditu.

Metodologia osoa eta galderak

Nola funtzionatzen duen

Enkarguak erreferentziaren forma guztiak zerrendatzen ditu, zenbaki zehatzekin. Modelo bakoitzak JSON hutsez erantzuten du: gehienez 150 kutxa, bakoitza bere kokapenarekin, neurriekin eta 11 koloreetako batekin. Modeloak berak ez du ezer marrazten. Exekuzio bati puntuazioa ematean, haren kutxak eta erreferentzia kubo txiki berberekin errenderatzen ditugu, argiztapen eta kamera berberak erabiliz, eta irudiak argitaratzen ditugu.

Puntuazioa eskulturaren eta erreferentziaren arteko bolumen-gainjartzearen emaitza da (ebakidura zati bildura, 1 cm-ko kuboetan neurtuta), bietan dauden kuboen artean kolore zuzena dutenen proportzioaz biderkatuta. Forma bakoitzeko kutxa bat erabiliz, 40 puntu baino gutxiago lortzen dira; forma bakoitza lodiera bereko xafletan zatituz, 50 puntu inguru. Hanka inklinatuek, kable meheek eta buru biribilek kutxa bakoitza non kokatu planifikatzen duten modeloak saritzen dituzte, eta Aldea ikuspegiak falta diren, soberan dauden eta kolore okerra duten kubo guztiak erakusten ditu.

Bidezkoa eta errepikagarria

Hasierako erreferentzia jatorrizko lehen saioa da, benetako neurketa-datekin gordeta. Abiarazterako neurtutako bigarren saio bat eskatu zen. Biak erakusten dira; ez zaio bati ere atzeragoko datarik esleitzen, eta ez da bietako onena hautatzen emaitza gisa. Ondorengo saioek asteko egutegiari jarraitzen diote.

  • Zereginaren deskribapen bera, puntuazioa kalkulatzeko programa bera eta ezarpen berak astero. Zereginaren deskribapenaren v3 bertsioak 08fb5a5773fe89e7 hatz-marka du; edozein aldaketak bertsio berri bat eta grafiko berri bat abiarazten ditu.
  • Eredu bakoitzak behin erantzuten du arrazoitzeko ahalegin ertainean, harpidetza batekin saioa hasita duen Claude Code edo Codex bidez, VibeiDEk exekutatzen dituen modu berean. Tresnarik ez, webik ez, berriro saiatzerik ez, N erantzunen artean onena hautatzerik ez.
  • Ereduak bata bestearen ondoren exekutatzen dira, inoiz ez paraleloan. 40 minutuan iristen ez den erantzunak 0 puntu jasotzen ditu.
  • Puntuazio-programa determinista da. Eredu batek ere ez du beste eredu bat ebaluatzen.

Irakurri zereginaren deskribapen osoa (testu arrunta, 7,691 karaktere). Modeloen izenak CLI bakoitzak eskaintzen dituen aliasak dira; orriak CLIak jakinarazitako modelo-identifikatzailea erregistratzen du.

Galderak

Claude edo GPT ahultzen ari dira?

Orrialde honek ezin du hornitzaile baten barruan zer gertatzen den ikusi, baina erakusten du ea izen bereko ereduak puntuazio desberdinak lortzen dituen denboran zehar ataza finko berean. Asteko exekuzio bakarra lagin bakarra da; beraz, hartu puntu gutxiko aldaketa zaratatzat, eta hainbat astez irauten duen beherakada seinaletzat.

Zergatik ezin du modelo batek ere 100 lortu?

Erreferentzia esferez, elipsoidez, zilindroz eta kapsula inklinatuz osatuta dago, eta erantzunean ardatzekin lerrokatutako 150 kutxa soilik erabil daitezke. Kutxek ezin dituzte kurbak zehatz jarraitu; beraz, erantzun guztiek bolumen pixka bat galtzen dute. Modelo hobeek kurbak dauden tokietan erabiltzen dituzte kutxak, eta haien eskulturek antz handiagoa dute erreferentziarekin.

Nola exekutatzen dira ereduak?

Modelo bakoitzak behin jasotzen du zereginaren deskribapena bere komando-lerroko tresna ofizialaren bidez, Claude Code edo Codex erabiliz, ohiko harpidetza batekin saioa hasita eta arrazoiketa-ahalegin ertainarekin. Tresnak, azpiagenteak, weberako sarbidea eta berriz saiatzea desgaituta daude; tresna bat erabiltzen duen exekuzioak 0 puntu jasotzen ditu. Programa determinista batek ematen dio puntuazioa erantzunari, ez beste modelo batek.

Zergatik aldatu zen errendimendu-proba v3 bertsiora?

Lehen bi bertsioetan, bulego bat antolatzeko eskatu zitzaien modeloei. Lehen txandetan, modelo onenek 100 eta 92 puntu lortu zituzten, eta zuzen egindako bulego guztiek itxura bera zuten. Modelo onenek puntuazio gorena lortzen duten proba batek ezin du bilakaera erakutsi, eta erantzun guztiek antzeko itxura duten proba batek ezin du kalitatea erakutsi. Horregatik, v3 bertsioak begiratu batean kalitatea antzemateko moduko eskultura bat eskatzen du.

Neuk proba dezaket ataza-deskribapena?

Bai. Zereginaren deskribapen osoa publikoki eskuragarri dago testu arruntean. Itsatsi edozein modelotan eta alderatu haren erantzuna erreferentziarekin.

Hizkuntzak

Necessary cookies support sign-in, security, your language and this choice. Optional categories stay off until accepted.

First-party page views and acquisition measurement, plus Google Analytics 4 (Google Ireland, data may reach the US). Advertising personalization stays off.

With Analytics enabled, retain Google and Microsoft ad click identifiers and share download, signup, activation and purchase conversions with the relevant ad provider. No personalized advertising.

Remember referral credit for later. Links still work on the current page without this cookie.

Privacy · Cookie inventory