ოფისის ბენჩმარკი

რომელი AI ქმნის საუკეთესოდ?

ექვსი მოდელი. ერთი დავალება. თითოეულს ერთი ცდა. შეფასება 0-დან 100-მდე, ზუსტ სამიზნესთან შედარებით.

რეიტინგი.

რა შექმნა თითოეულმა მოდელმა.

დაუმუშავებელი შედეგი, ვიზუალურად წარმოდგენილი თითოეული მოდელის მიერ დაბრუნებული JSON-ის მიხედვით. ერთი ცდა, განმეორებითი მცდელობების გარეშე.

კვირა 2026-W41

ყველა სკულპტურას ერთნაირი განათება, კამერა და მასშტაბი აქვს. აირჩიეთ ნებისმიერი შედეგი ნიმუშთან შესადარებლად, ან გადადით „განსხვავების“ რეჟიმზე შეუსაბამობების შესამოწმებლად.

  1. Claude Opus 5.578.5/100Claude Opus 5.5-ის სკულპტურა
  2. GPT-6.1 Sol74.7/100GPT-6.1 Sol-ის სკულპტურა
  3. Claude Fable74.6/100Claude Fable-ის სკულპტურა
  4. GPT-6 Astra73.5/100GPT-6 Astra-ს სკულპტურა
  5. Claude Sonnet 5.548.1/100Claude Sonnet 5.5-ის სკულპტურა
  6. GPT-6 Luna30.9/100GPT-6 Luna-ს სკულპტურა

ხარისხი, ტოკენები და დრო

რა რესურსი დასჭირდა თითოეულ შედეგს?

შეადარეთ არჩეული რაუნდის ქულა, აღრიცხული შემავალი და გამომავალი ტოკენების ჯამი და შესრულებაზე დახარჯული დრო. მსჯელობის ტოკენები ხელახლა არ ემატება. გამოტოვებული გაზომვები არ ითვლება ნულად და შედარებაში არ შედის.

ნახეთ ტოკენებისა და შესრულების დროის გაზომვები

გაზომილი შედეგები

რაუნდების შედარება.

საწყის მაჩვენებლებში შენარჩუნებულია პირველი რაუნდის თავდაპირველი შედეგები და გაზომვის თარიღები. შემდეგი წერტილი ახლად გაზომილ რაუნდს ასახავს და არა სხვა კვირის შედეგს.

ნახეთ დაფიქსირებული ქულები
ქულა 100-დან, რაუნდების მიხედვით
რაუნდიClaude Opus 5 / Claude Opus 5.5Claude Sonnet 5 / Claude Sonnet 5.5Claude FableGPT-6.1 SolGPT-6 AstraGPT-6 Luna
2026-W4178.5 (Claude Opus 5.5)48.1 (Claude Sonnet 5.5)74.6 (Claude Fable)74.7 (GPT-6.1 Sol)73.5 (GPT-6 Astra)30.9 (GPT-6 Luna)
საწყისი მაჩვენებლები75.5 (Claude Opus 5)34.3 (Claude Sonnet 5)71.2 (Claude Fable)70.6 (GPT-6.1 Sol)77.5 (GPT-6 Astra)45.6 (GPT-6 Luna)

ბენჩმარკის შესახებ

მიეცით AI-ს 150 მართკუთხა ბლოკი. სთხოვეთ, ეს შექმნას.

მრგვალი თავი. მომრგვალებული სკამი. პატარა მაგიდის სანათი. რამდენად ზუსტად შეძლებს ენობრივი მოდელი ამის გამეორებას მხოლოდ მართკუთხა ბლოკებით?

ნიმუში: თეთრი რობოტი მწვანე სკამზე, მრგვალ მაგიდასთან, რომელზეც მონიტორი, სანათი, ჭიქა და მცენარე დგას
ხელახლა შესაქმნელი სკულპტურა. 56 ფორმა.
ყუთი მაქსიმუმ
150
მოდელი
6
მცდელობა თითო რაუნდში
1

როგორ მუშაობს.

უცვლელი დავალება.

ყველა მოდელი იღებს ერთსა და იმავე წერილობით დავალებას, რომელშიც მითითებულია სამიზნის ზომები და ფერები. დავალების სრული ტექსტი საჯაროა.

მხოლოდ JSON.

პასუხი სხვა არაფერს შეიცავს: მაქსიმუმ 150 მართკუთხა ბლოკს მათი პოზიციებით, ზომებითა და ფერებით.

ერთი ცდა.

მსჯელობის საშუალო ინტენსივობა, ხელსაწყოებისა და განმეორებითი მცდელობების გარეშე. აღირიცხება ტოკენების რაოდენობა და შესრულების დრო.

უცვლელი შეფასების ალგორითმი.

სამიზნესთან მოცულობითი თანხვედრა, ფერების სიზუსტის გათვალისწინებით, 0-დან 100-მდე.

ფორმულა

მოცულობითი თანხვედრა % × სწორად შეფერილი კუბების წილი

იზომება 1 cm³ ერთეულებით. დავალების ციფრული ანაბეჭდი 08fb5a5773fe89e7. საწყის საბაზისო მაჩვენებლად შენარჩუნებულია პირველი რაუნდის თავდაპირველი შედეგები.

სრული მეთოდოლოგია და კითხვები

როგორ მუშაობს

დავალებაში ნიმუშის ყველა ფორმა ზუსტი რიცხვითი მონაცემებითაა ჩამოთვლილი. თითოეული მოდელი პასუხს მხოლოდ JSON ფორმატში აბრუნებს: მაქსიმუმ 150 ყუთი, თითოეულისთვის მითითებული მდებარეობით, ზომითა და 11 ფერიდან ერთ-ერთით. თავად მოდელი არაფერს ხატავს. შედეგის შეფასებისას მის ყუთებსა და ნიმუშს ერთნაირი პატარა კუბებით, ერთნაირი განათებითა და კამერით ვასახავთ და გამოსახულებებს ვაქვეყნებთ.

ქულა მიიღება ქანდაკებისა და ნიმუშის მოცულობითი თანხვედრის, ანუ გადაკვეთის გაერთიანებასთან შეფარდების, გამრავლებით საერთო კუბებს შორის სწორი ფერის მქონე კუბების წილზე. მოცულობა 1 სმ ზომის კუბებით იზომება. თითო ფორმაზე ერთი ბლოკის გამოყენება 40-ზე ნაკლებ ქულას იძლევა; ყველა ფორმის თანაბარ ფენებად დაყოფა კი დაახლოებით 50 ქულას. დახრილი ფეხები, თხელი კაბელები და მრგვალი თავები უპირატესობას აძლევს მოდელებს, რომლებიც თითოეული ბლოკის განთავსებას გეგმავენ, ხოლო განსხვავების ხედში ყველა ნაკლული, ზედმეტი და არასწორად შეფერილი კუბი ჩანს.

სამართლიანი და გამეორებადი

საწყისი მაჩვენებლები თავდაპირველ პირველ რაუნდს ასახავს და გაზომვის რეალურ თარიღებს ინარჩუნებს. გაშვებისთვის მეორე გაზომილი რაუნდიც მოითხოვეს. ნაჩვენებია ორივე რაუნდი; არცერთს არ აქვს წარსული თარიღი ხელოვნურად მინიჭებული და არცერთი არ არის შერჩეული, როგორც ამ ორიდან საუკეთესო შედეგი. შემდგომი რაუნდები ყოველკვირეულ განრიგს მიჰყვება.

  • ყოველ კვირას იგივე დავალება, იგივე შემფასებელი და იგივე პარამეტრები გამოიყენება. დავალების v3-ის ანაბეჭდია 08fb5a5773fe89e7; ნებისმიერი ცვლილება ახალ ვერსიასა და ახალ გრაფიკს იწყებს.
  • თითოეული მოდელი პასუხობს ერთხელ, მსჯელობის საშუალო ინტენსივობით, გამოწერით ავტორიზებული Claude Code-ის ან Codex-ის მეშვეობით, ზუსტად ისე, როგორც მათ VibeiDE უშვებს. ხელსაწყოების, ვების, განმეორებითი ცდებისა და N პასუხიდან საუკეთესოს არჩევის გარეშე.
  • მოდელები ეშვება ერთმანეთის მიყოლებით და არასდროს პარალელურად. პასუხი, რომელიც 40 წუთში არ მოვა, 0 ქულას იღებს.
  • შემფასებელი დეტერმინისტული პროგრამაა. არცერთი მოდელი არ აფასებს სხვა მოდელს.

წაიკითხეთ დავალების სრული ტექსტი (ჩვეულებრივი ტექსტი, 7,691 სიმბოლო). მოდელების სახელები ის ალიასებია, რომლებსაც თითოეული CLI გვთავაზობს; გვერდზე ინახება CLI-ის მიერ მოწოდებული მოდელის იდენტიფიკატორი.

კითხვები

ხომ არ სუსტდება Claude ან GPT?

ეს გვერდი პროვაიდერის შიდა პროცესებს ვერ ხედავს, თუმცა აჩვენებს, იცვლება თუ არა დროთა განმავლობაში ერთი და იმავე სახელის მქონე მოდელის ქულა უცვლელ დავალებაზე. კვირაში ერთი გაშვება მხოლოდ ერთი დაკვირვებაა, ამიტომ რამდენიმე ქულით ცვლილება შემთხვევით რყევად მიიჩნიეთ, ხოლო რამდენიმე კვირის განმავლობაში შენარჩუნებული ვარდნა სიგნალად.

რატომ ვერ აღწევს ვერცერთი მოდელი 100 ქულას?

ნიმუში სფეროების, ელიფსოიდების, ცილინდრებისა და დახრილი კაფსულებისგან შედგება, პასუხში კი მხოლოდ 150 ღერძების გასწვრივ განლაგებული მართკუთხა ბლოკის გამოყენებაა დაშვებული. ბლოკები მრუდებს ზუსტად ვერ იმეორებს, ამიტომ ყველა პასუხში მოცულობის ნაწილი იკარგება. უკეთესი მოდელები ბლოკებს მრუდე მონაკვეთებზე ანაწილებენ და მათი ქანდაკებები ნიმუშს უფრო ჰგავს.

როგორ უშვებთ მოდელებს?

თითოეული მოდელი დავალებას ერთხელ იღებს თავისი ოფიციალური ბრძანების სტრიქონის ხელსაწყოს, Claude Code-ის ან Codex-ის მეშვეობით, ჩვეულებრივი გამოწერით ავტორიზაციისა და მსჯელობის საშუალო ინტენსივობის პირობებში. ხელსაწყოები, ქვეაგენტები, ვებწვდომა და განმეორებითი მცდელობები გამორთულია; გაშვება, რომელიც ხელსაწყოს გამოიყენებს, 0 ქულას იღებს. პასუხს აფასებს დეტერმინისტული პროგრამა და არა სხვა მოდელი.

რატომ გადავიდა ბენჩმარკი v3-ზე?

პირველ ორ ვერსიაში მოდელებს ოფისის მოწყობა ევალებოდათ. პირველ რაუნდებში საუკეთესო მოდელებმა 100 და 92 ქულა მიიღეს და ყველა სწორად მოწყობილი ოფისი ერთნაირად გამოიყურებოდა. ბენჩმარკი, რომელშიც საუკეთესო მოდელები მაქსიმალურ ქულას იღებენ, ცვლილებას ვერ აჩვენებს, ხოლო მსგავსი პასუხებით ხარისხის განსხვავება არ ჩანს. ამიტომ v3-ში დავალება ქანდაკების შექმნაა, რომლის ხარისხიც ერთი შეხედვით ჩანს.

შემიძლია დავალება თავად ვცადო?

დიახ. დავალების სრული ტექსტი საჯაროდ ხელმისაწვდომია ჩვეულებრივი ტექსტის სახით. ჩასვით ის ნებისმიერ მოდელში და შეადარეთ მისი პასუხი ნიმუშს.

ენები

Necessary cookies support sign-in, security, your language and this choice. Optional categories stay off until accepted.

First-party page views and acquisition measurement, plus Google Analytics 4 (Google Ireland, data may reach the US). Advertising personalization stays off.

With Analytics enabled, retain Google and Microsoft ad click identifiers and share download, signup, activation and purchase conversions with the relevant ad provider. No personalized advertising.

Remember referral credit for later. Links still work on the current page without this cookie.

Privacy · Cookie inventory