Δοκιμασία γραφείου

Ποια AI κατασκευάζει καλύτερα;

Έξι μοντέλα. Μία περιγραφή απαιτήσεων. Μία προσπάθεια για το καθένα. Βαθμολογία από 0 έως 100 με βάση την ακριβή αντιστοιχία με το πρότυπο.

Κατάταξη.

Τι κατασκεύασε κάθε μοντέλο.

Το ακατέργαστο αποτέλεσμα, όπως αποδίδεται οπτικά από το JSON που επέστρεψε κάθε μοντέλο. Μία προσπάθεια, χωρίς επαναλήψεις.

Εβδομάδα 2026-W41

Κάθε γλυπτό παρουσιάζεται με τον ίδιο φωτισμό, την ίδια κάμερα και την ίδια κλίμακα. Επιλέξτε οποιοδήποτε αποτέλεσμα για να το συγκρίνετε με τον στόχο ή μεταβείτε στην προβολή Διαφορά για να εξετάσετε τις αποκλίσεις.

  1. Claude Opus 5.578.5/100Γλυπτό του Claude Opus 5.5
  2. GPT-6.1 Sol74.7/100Γλυπτό του GPT-6.1 Sol
  3. Claude Fable74.6/100Γλυπτό του Claude Fable
  4. GPT-6 Astra73.5/100Γλυπτό του GPT-6 Astra
  5. Claude Sonnet 5.548.1/100Γλυπτό του Claude Sonnet 5.5
  6. GPT-6 Luna30.9/100Γλυπτό του GPT-6 Luna

Ποιότητα, tokens και χρόνος

Τι απαιτήθηκε για κάθε αποτέλεσμα;

Συγκρίνετε τη βαθμολογία, το αναφερόμενο σύνολο των tokens εισόδου και εξόδου και τον χρόνο εκτέλεσης για τον επιλεγμένο γύρο. Τα tokens συλλογισμού δεν προσμετρώνται ξανά. Οι μετρήσεις που λείπουν παραλείπονται και δεν υπολογίζονται ως μηδενικές.

Δείτε τις μετρήσεις tokens και χρόνου εκτέλεσης

Αποτελέσματα μετρήσεων

Από γύρο σε γύρο.

Η αρχική βάση σύγκρισης διατηρεί τα αρχικά αποτελέσματα του πρώτου γύρου και τις ημερομηνίες των μετρήσεων. Το επόμενο σημείο αντιστοιχεί σε έναν νέο γύρο μετρήσεων, όχι σε αποτέλεσμα από διαφορετική εβδομάδα.

Δείτε τις καταγεγραμμένες βαθμολογίες
Βαθμολογία με άριστα το 100 ανά γύρο
ΓύροςClaude Opus 5 / Claude Opus 5.5Claude Sonnet 5 / Claude Sonnet 5.5Claude FableGPT-6.1 SolGPT-6 AstraGPT-6 Luna
2026-W4178.5 (Claude Opus 5.5)48.1 (Claude Sonnet 5.5)74.6 (Claude Fable)74.7 (GPT-6.1 Sol)73.5 (GPT-6 Astra)30.9 (GPT-6 Luna)
Αρχική βάση σύγκρισης75.5 (Claude Opus 5)34.3 (Claude Sonnet 5)71.2 (Claude Fable)70.6 (GPT-6.1 Sol)77.5 (GPT-6 Astra)45.6 (GPT-6 Luna)

Σχετικά με τη δοκιμασία

Δώστε σε μια AI 150 παραλληλεπίπεδα. Ζητήστε της να φτιάξει αυτό.

Ένα στρογγυλό κεφάλι. Μια καμπύλη καρέκλα. Ένα μικροσκοπικό φωτιστικό γραφείου. Πόσο κοντά μπορεί να φτάσει ένα γλωσσικό μοντέλο χρησιμοποιώντας μόνο ορθογώνια μπλοκ;

Ο στόχος: ένα λευκό ρομπότ σε μια πράσινη καρέκλα, μπροστά σε ένα στρογγυλό γραφείο με οθόνη, φωτιστικό, κούπα και φυτό
Το γλυπτό προς αναδημιουργία. 56 σχήματα.
κουτιά το πολύ
150
μοντέλα
6
προσπάθεια ανά γύρο
1

Πώς λειτουργεί.

Μια οριστικοποιημένη περιγραφή απαιτήσεων.

Κάθε μοντέλο λαμβάνει την ίδια γραπτή περιγραφή απαιτήσεων με τις διαστάσεις και τα χρώματα του προτύπου. Η πλήρης περιγραφή είναι δημόσια διαθέσιμη.

Μόνο JSON.

Η απάντηση δεν περιέχει τίποτε άλλο: έως 150 παραλληλεπίπεδα με θέσεις, διαστάσεις και χρώματα.

Μία προσπάθεια.

Μέτρια ένταση συλλογισμού, χωρίς εργαλεία, χωρίς επαναλήψεις. Καταγράφονται τα token και ο χρόνος εκτέλεσης.

Ένας οριστικοποιημένος μηχανισμός βαθμολόγησης.

Επικάλυψη όγκου με το πρότυπο, σταθμισμένη με βάση την ακρίβεια των χρωμάτων, από 0 έως 100.

Ο τύπος

ποσοστό επικάλυψης όγκου % × ποσοστό κύβων με το σωστό χρώμα

Μετριέται σε μονάδες του 1 cm³. Ψηφιακό αποτύπωμα της περιγραφής απαιτήσεων 08fb5a5773fe89e7. Η αρχική βάση σύγκρισης διατηρεί τα αρχικά αποτελέσματα του πρώτου γύρου.

Πλήρης μεθοδολογία και ερωτήσεις

Πώς λειτουργεί

Οι προδιαγραφές παραθέτουν κάθε σχήμα του προτύπου με ακριβείς αριθμητικές τιμές. Κάθε μοντέλο απαντά αποκλειστικά με JSON: έως 150 ορθογώνια παραλληλεπίπεδα, καθένα με θέση, μέγεθος και ένα από τα 11 χρώματα. Το μοντέλο δεν σχεδιάζει τίποτα το ίδιο. Όταν βαθμολογούμε μια εκτέλεση, αποδίδουμε τα ορθογώνια παραλληλεπίπεδά της και το πρότυπο με τους ίδιους μικρούς κύβους, με τον ίδιο φωτισμό και την ίδια κάμερα, και δημοσιεύουμε τις εικόνες.

Η βαθμολογία ισούται με την επικάλυψη όγκου μεταξύ γλυπτού και προτύπου (τομή προς ένωση, μετρημένη σε κύβους 1 cm), πολλαπλασιασμένη με το ποσοστό των κοινών κύβων που έχουν το σωστό χρώμα. Η χρήση ενός παραλληλεπιπέδου ανά σχήμα δίνει βαθμολογία κάτω από 40. Ο τεμαχισμός κάθε σχήματος σε ισοπαχείς φέτες δίνει περίπου 50. Τα κεκλιμένα πόδια, τα λεπτά καλώδια και τα στρογγυλά κεφάλια επιβραβεύουν τα μοντέλα που σχεδιάζουν πού θα τοποθετηθεί κάθε παραλληλεπίπεδο, ενώ η προβολή Διαφορά δείχνει κάθε κύβο που λείπει, περισσεύει ή έχει λάθος χρώμα.

Δίκαιη και επαναλήψιμη διαδικασία

Η αρχική βάση σύγκρισης είναι ο αρχικός πρώτος γύρος, που διατηρείται με τις πραγματικές ημερομηνίες των μετρήσεών του. Ζητήθηκε ένας δεύτερος γύρος μετρήσεων για την κυκλοφορία. Εμφανίζονται και οι δύο, χωρίς να έχει αποδοθεί σε κανέναν προγενέστερη ημερομηνία ή να έχει επιλεγεί ο καλύτερος από τους δύο ως τελικό αποτέλεσμα. Οι επόμενοι γύροι ακολουθούν το εβδομαδιαίο πρόγραμμα.

  • Ίδιες προδιαγραφές, ίδιο πρόγραμμα βαθμολόγησης και ίδιες ρυθμίσεις κάθε εβδομάδα. Οι προδιαγραφές v3 έχουν το αποτύπωμα 08fb5a5773fe89e7. Κάθε αλλαγή ξεκινά νέα έκδοση και νέο γράφημα.
  • Κάθε μοντέλο απαντά μία φορά με μεσαίο επίπεδο συλλογιστικής προσπάθειας, μέσω του Claude Code ή του Codex με σύνδεση μέσω συνδρομής, με τον ίδιο τρόπο που τα εκτελεί το VibeiDE. Χωρίς εργαλεία, πρόσβαση στον ιστό, επαναλήψεις ή επιλογή της καλύτερης από N απαντήσεις.
  • Τα μοντέλα εκτελούνται το ένα μετά το άλλο, ποτέ παράλληλα. Μια απάντηση που δεν φτάνει εντός 40 λεπτών παίρνει 0.
  • Το πρόγραμμα βαθμολόγησης είναι ντετερμινιστικό. Κανένα μοντέλο δεν βαθμολογεί άλλο μοντέλο.

Διαβάστε τις πλήρεις προδιαγραφές (απλό κείμενο, 7,691 χαρακτήρες). Τα ονόματα των μοντέλων είναι τα ψευδώνυμα που προσφέρει κάθε CLI. Η σελίδα καταγράφει το αναγνωριστικό μοντέλου που ανέφερε το CLI.

Ερωτήσεις

Μειώνονται οι δυνατότητες του Claude ή του GPT;

Αυτή η σελίδα δεν έχει πρόσβαση στις εσωτερικές λειτουργίες ενός παρόχου, αλλά δείχνει αν το ίδιο όνομα μοντέλου παίρνει διαφορετική βαθμολογία στην ίδια αμετάβλητη εργασία με την πάροδο του χρόνου. Μία εκτέλεση την εβδομάδα αποτελεί ένα μόνο δείγμα, οπότε θεωρήστε μια μεταβολή λίγων μονάδων ως θόρυβο και μια πτώση που διαρκεί αρκετές εβδομάδες ως ένδειξη.

Γιατί κανένα μοντέλο δεν μπορεί να φτάσει το 100;

Το πρότυπο αποτελείται από σφαίρες, ελλειψοειδή, κυλίνδρους και κεκλιμένες κάψουλες, ενώ η απάντηση επιτρέπεται να χρησιμοποιεί μόνο 150 ορθογώνια παραλληλεπίπεδα ευθυγραμμισμένα με τους άξονες. Τα παραλληλεπίπεδα δεν μπορούν να ακολουθήσουν με ακρίβεια τις καμπύλες, οπότε κάθε απάντηση χάνει μέρος του όγκου. Τα καλύτερα μοντέλα κατανέμουν τα παραλληλεπίπεδά τους στα σημεία με καμπύλες και τα γλυπτά τους μοιάζουν περισσότερο με το πρότυπο.

Πώς εκτελούνται τα μοντέλα;

Κάθε μοντέλο λαμβάνει τις προδιαγραφές μία φορά μέσω του επίσημου εργαλείου γραμμής εντολών του, Claude Code ή Codex, με σύνδεση μέσω κανονικής συνδρομής και μεσαίο επίπεδο συλλογιστικής προσπάθειας. Τα εργαλεία, οι υποπράκτορες, η πρόσβαση στο διαδίκτυο και οι επαναλήψεις είναι απενεργοποιημένα. Μια εκτέλεση που χρησιμοποιεί εργαλείο βαθμολογείται με 0. Η απάντηση βαθμολογείται από ντετερμινιστικό πρόγραμμα και όχι από άλλο μοντέλο.

Γιατί η δοκιμασία αξιολόγησης πέρασε στην έκδοση v3;

Οι δύο πρώτες εκδόσεις ζητούσαν από τα μοντέλα να διαμορφώσουν έναν χώρο γραφείου. Στους πρώτους γύρους τους, τα καλύτερα μοντέλα σημείωσαν 100 και 92, ενώ κάθε σωστά διαμορφωμένο γραφείο έμοιαζε ίδιο. Μια δοκιμασία στην οποία τα κορυφαία μοντέλα φτάνουν τη μέγιστη βαθμολογία δεν μπορεί να αναδείξει την εξέλιξή τους, ενώ μια δοκιμασία με παρόμοιες απαντήσεις δεν μπορεί να αναδείξει την ποιότητα. Γι' αυτό η v3 ζητά ένα γλυπτό του οποίου η ποιότητα φαίνεται με μια ματιά.

Μπορώ να δοκιμάσω τις οδηγίες μόνος μου;

Ναι. Οι πλήρεις προδιαγραφές είναι δημόσια διαθέσιμες σε απλό κείμενο. Επικολλήστε τις σε οποιοδήποτε μοντέλο και συγκρίνετε την απάντησή του με το πρότυπο.

Γλώσσες

Necessary cookies support sign-in, security, your language and this choice. Optional categories stay off until accepted.

First-party page views and acquisition measurement, plus Google Analytics 4 (Google Ireland, data may reach the US). Advertising personalization stays off.

With Analytics enabled, retain Google and Microsoft ad click identifiers and share download, signup, activation and purchase conversions with the relevant ad provider. No personalized advertising.

Remember referral credit for later. Links still work on the current page without this cookie.

Privacy · Cookie inventory