Testi krahasues Office

Cila AI ndërton më mirë?

Gjashtë modele. Një përshkrim detyre. Nga një përpjekje secili. Vlerësim nga 0 në 100 kundrejt objektivit të saktë.

Renditja.

Çfarë ndërtoi secili model.

Rezultati i papërpunuar, i vizualizuar nga JSON-i që ktheu secili model. Një përpjekje, pa riprovime.

Java 2026-W41

Çdo skulpturë përdor të njëjtin ndriçim, kamerë dhe shkallë. Zgjidh cilindo rezultat për ta krahasuar me objektivin, ose kalo te Dallimi për të shqyrtuar mospërputhjet.

  1. Claude Opus 5.578.5/100Skulptura e Claude Opus 5.5
  2. GPT-6.1 Sol74.7/100Skulptura e GPT-6.1 Sol
  3. Claude Fable74.6/100Skulptura e Claude Fable
  4. GPT-6 Astra73.5/100Skulptura e GPT-6 Astra
  5. Claude Sonnet 5.548.1/100Skulptura e Claude Sonnet 5.5
  6. GPT-6 Luna30.9/100Skulptura e GPT-6 Luna

Cilësia, tokenët dhe koha

Çfarë u desh për të arritur secilin rezultat?

Krahaso vlerësimin, shumën e raportuar të tokenëve të hyrjes dhe të daljes, si dhe kohën e ekzekutimit për raundin e zgjedhur. Tokenët e arsyetimit nuk shtohen përsëri. Matjet që mungojnë lihen jashtë dhe nuk llogariten si zero.

Shiko matjet e tokenëve dhe të kohës së ekzekutimit

Rezultatet e matura

Nga një raund në tjetrin.

Pikënisja ruan rezultatet origjinale të raundit të parë dhe datat e matjeve. Pika pasuese është një raund i ri i matur, jo një rezultat nga një javë tjetër.

Shiko vlerësimet e regjistruara
Vlerësimi nga 100 pikë për çdo raund
RaundiClaude Opus 5 / Claude Opus 5.5Claude Sonnet 5 / Claude Sonnet 5.5Claude FableGPT-6.1 SolGPT-6 AstraGPT-6 Luna
2026-W4178.5 (Claude Opus 5.5)48.1 (Claude Sonnet 5.5)74.6 (Claude Fable)74.7 (GPT-6.1 Sol)73.5 (GPT-6 Astra)30.9 (GPT-6 Luna)
Pikënisja75.5 (Claude Opus 5)34.3 (Claude Sonnet 5)71.2 (Claude Fable)70.6 (GPT-6.1 Sol)77.5 (GPT-6 Astra)45.6 (GPT-6 Luna)

Rreth testit krahasues

Jepi një AI-je 150 kuti. Kërkoji të ndërtojë këtë.

Një kokë e rrumbullakët. Një karrige e lakuar. Një llambë e vogël tryeze. Sa mund t’i afrohet një model gjuhësor duke përdorur vetëm blloqe drejtkëndëshe?

Objektivi: një robot i bardhë në një karrige të gjelbër pranë një tryeze të rrumbullakët me monitor, llambë, filxhan dhe bimë
Skulptura që duhet rikrijuar. 56 forma.
kuti maksimumi
150
modele
6
përpjekje për raund
1

Si funksionon.

Një përshkrim detyre i pandryshueshëm.

Çdo model merr të njëjtin përshkrim të shkruar të detyrës, me përmasat dhe ngjyrat e objektivit. Përshkrimi i plotë është publik.

Vetëm JSON.

Përgjigjja nuk përmban asgjë tjetër: deri në 150 kuti me pozicionet, përmasat dhe ngjyrat e tyre.

Një përpjekje.

Nivel mesatar arsyetimi, pa mjete, pa riprovime. Regjistrohen tokenët dhe koha e ekzekutimit.

Një sistem vlerësimi i pandryshueshëm.

Mbivendosja vëllimore me objektivin, e peshuar sipas saktësisë së ngjyrave, nga 0 në 100.

Formula

përqindja e mbivendosjes vëllimore × pjesa e kubeve me ngjyrën e saktë

Matet në njësi prej 1 cm³. Gjurmë identifikuese e përshkrimit të detyrës 08fb5a5773fe89e7. Baza fillestare e krahasimit ruan rezultatet origjinale të raundit të parë.

Metodologjia e plotë dhe pyetjet

Si funksionon

Përshkrimi i detyrës rendit çdo formë të modelit të referencës me vlera numerike të sakta. Çdo model përgjigjet vetëm me JSON: deri në 150 blloqe, secili me një pozicion, përmasa dhe një nga 11 ngjyrat. Vetë modeli nuk vizaton asgjë. Kur vlerësojmë një ekzekutim, i paraqesim grafikisht blloqet e tij dhe modelin e referencës duke përdorur të njëjtat kube të vogla, të njëjtin ndriçim dhe të njëjtën kamerë, dhe i publikojmë imazhet.

Rezultati llogaritet duke shumëzuar mbivendosjen vëllimore mes skulpturës dhe modelit të synuar (raporti i prerjes me bashkimin, i matur me kube 1 cm) me përqindjen e kubeve të përbashkëta që kanë ngjyrën e duhur. Përdorimi i një kutie për çdo formë jep më pak se 40 pikë; ndarja e çdo forme në shtresa të barabarta jep rreth 50 pikë. Këmbët e pjerrëta, kabllot e holla dhe kokat e rrumbullakëta u japin më shumë pikë modeleve që planifikojnë vendosjen e çdo kutie, ndërsa pamja Dallimi tregon çdo kub që mungon, është i tepërt ose ka ngjyrë të gabuar.

I drejtë dhe i përsëritshëm

Pikënisja është raundi i parë origjinal, i ruajtur me datat reale të matjeve. Për lançimin u kërkua një raund i dytë i matur. Shfaqen të dy raundet; asnjërit nuk i është vendosur një datë e mëparshme dhe asnjëri nuk është përzgjedhur si rezultati më i mirë nga të dy. Raundet e mëvonshme ndjekin orarin javor.

  • E njëjta kërkesë, i njëjti program vlerësimi dhe të njëjtat cilësime çdo javë. Kërkesa v3 ka gjurmën identifikuese 08fb5a5773fe89e7; çdo ndryshim nis një version të ri dhe një grafik të ri.
  • Çdo model përgjigjet një herë me nivel mesatar përpjekjeje arsyetimi, përmes Claude Code ose Codex me hyrje përmes një abonimi, në të njëjtën mënyrë si i ekzekuton VibeiDE. Pa mjete, pa ueb, pa riprovime dhe pa përzgjedhjen e përgjigjes më të mirë nga N prova.
  • Modelet ekzekutohen njëri pas tjetrit, kurrë paralelisht. Një përgjigje që nuk mbërrin brenda 40 minutash merr 0 pikë.
  • Programi i vlerësimit është determinist. Asnjë model nuk vlerëson një model tjetër.

Lexo kërkesën e plotë (tekst i thjeshtë, 7,691 karaktere). Emrat e modeleve janë emrat alternativë që ofron secili CLI; faqja regjistron identifikuesin e modelit të raportuar nga CLI.

Pyetje

A po dobësohen Claude ose GPT?

Kjo faqe nuk mund të shohë çfarë ndodh brenda një ofruesi, por tregon nëse i njëjti emër modeli merr rezultate të ndryshme në të njëjtën detyrë të pandryshueshme me kalimin e kohës. Një provë në javë është vetëm një kampion, ndaj trajto një lëvizje prej pak pikësh si luhatje rastësore dhe një rënie që zgjat disa javë si sinjal.

Pse asnjë model nuk arrin 100 pikë?

Modeli i synuar përbëhet nga sfera, elipsoide, cilindra dhe kapsula të pjerrëta, ndërsa përgjigjja mund të përdorë vetëm 150 kuti të rreshtuara sipas boshteve. Kutitë nuk mund t'i ndjekin me saktësi lakimet, ndaj çdo përgjigje humbet një pjesë të vëllimit. Modelet më të mira i përdorin kutitë aty ku ka lakime dhe skulpturat e tyre i ngjajnë më shumë modelit të synuar.

Si ekzekutohen modelet?

Çdo model e merr kërkesën një herë përmes mjetit të vet zyrtar të rreshtit të komandave, Claude Code ose Codex, me një abonim të zakonshëm dhe me nivel mesatar arsyetimi. Mjetet, nënagjentët, qasja në internet dhe riprovimet janë të çaktivizuara; një ekzekutim që përdor një mjet merr 0 pikë. Përgjigjja vlerësohet nga një program determinist, jo nga një model tjetër.

Pse testi krahasues kaloi në v3?

Dy versionet e para u kërkonin modeleve të projektonin një zyrë. Në raundet e tyre të para, modelet më të mira morën 100 dhe 92 pikë, dhe çdo zyrë e saktë dukej njësoj. Një test krahasues ku modelet më të mira arrijnë maksimumin nuk mund të tregojë ndryshimin, ndërsa një test ku përgjigjet ngjajnë me njëra-tjetrën nuk mund të tregojë cilësinë. Prandaj v3 kërkon një skulpturë, cilësia e së cilës dallohet me një shikim.

A mund ta provoj vetë detyrën?

Po. Kërkesa e plotë është publike si tekst i thjeshtë. Ngjite në cilindo model dhe krahaso përgjigjen e tij me modelin e synuar.

Gjuhët

Necessary cookies support sign-in, security, your language and this choice. Optional categories stay off until accepted.

First-party page views and acquisition measurement, plus Google Analytics 4 (Google Ireland, data may reach the US). Advertising personalization stays off.

With Analytics enabled, retain Google and Microsoft ad click identifiers and share download, signup, activation and purchase conversions with the relevant ad provider. No personalized advertising.

Remember referral credit for later. Links still work on the current page without this cookie.

Privacy · Cookie inventory