Τα κορυφαία γλωσσικά μοντέλα δεν διαφέρουν μόνο στο αν υπακούν σε ένα πιεστικό prompt, αλλά κυρίως στο πώς αντιδρούν όταν δεν το ακολουθούν πλήρως.
Η πρωτογενής μελέτη σε έξι μοντέλα καταγράφει διευκρινίσεις, άρνηση με εναλλακτική, ρητή ένσταση με συνέχιση και πλήρη διακοπή ως διαφορετικές λειτουργικές συμπεριφορές. Για μια επιχείρηση, αυτές οι κατηγορίες πρέπει να γίνουν acceptance criteria πριν το AI μπει σε customer support, marketing ή agentic αυτοματισμούς.
Όταν δύο γλωσσικά μοντέλα δέχονται ακριβώς το ίδιο prompt, δεν είναι καθόλου βέβαιο ότι θα διαφωνήσουν μόνο στην ποιότητα της απάντησης. Μπορεί να ακολουθήσουν εντελώς διαφορετική συμπεριφορική διαδρομή: το ένα να συμμορφωθεί, το άλλο να ζητήσει διευκρίνιση, ένα τρίτο να απορρίψει το πλαίσιο και ένα τέταρτο να απαντήσει προσφέροντας ασφαλέστερη εναλλακτική. Αυτό είναι το κεντρικό εύρημα της μελέτης Divergent Response Modes in Frontier Language Models Under Steering Pressure, η οποία συγκρίνει έξι μοντέλα από έξι διαφορετικούς developers.
Για επαγγελματίες, e-commerce ομάδες, marketers και ιδιοκτήτες επιχειρήσεων, η σημασία είναι άμεση. Η επιλογή μοντέλου δεν μπορεί να βασίζεται αποκλειστικά σε ένα γενικό benchmark, στην τιμή ανά token ή σε μια εντυπωσιακή επίδειξη. Αν το AI συμμετέχει σε customer support, δημιουργία περιεχομένου, moderation, έρευνα ή agentic αυτοματισμούς, ο τρόπος με τον οποίο αντιδρά σε πίεση αποτελεί λειτουργικό χαρακτηριστικό του συστήματος.
Η steerability δεν είναι μόνο «πόσο υπακούει»
Οι περισσότερες αξιολογήσεις steerability εξετάζουν αν ένα μοντέλο έφτασε στον στόχο που έθεσε η οδηγία. Η συγκεκριμένη εργασία αλλάζει την ερώτηση: όταν το μοντέλο δεν ακολουθεί πλήρως την πίεση, τι ακριβώς κάνει; Η άρνηση χωρίς συνέχεια, η άρνηση με εναλλακτική, η συμμόρφωση με ρητή επιφύλαξη και η διευκρινιστική ερώτηση δεν είναι ισοδύναμες συμπεριφορές.
Αυτή η διάκριση έχει πρακτικό βάρος. Σε ένα help desk για e-commerce ή εξυπηρέτηση πελατών, η απλή άρνηση μπορεί να δημιουργεί αδιέξοδο, ενώ μια ασφαλής εναλλακτική κρατά τον πελάτη μέσα στη ροή εξυπηρέτησης. Σε ένα εργαλείο marketing, η συμμόρφωση με προβληματικό framing μπορεί να εκθέσει το brand. Σε έναν agent που εκτελεί ενέργειες, η τάση να ζητά διευκρίνιση μπορεί να είναι πολύτιμος μηχανισμός ελέγχου ή, αν εμφανίζεται υπερβολικά, σημείο τριβής.
Πώς σχεδιάστηκε η σύγκριση των έξι μοντέλων
Το benchmark περιλάμβανε 340 items: 100 για σύγκρουση αξιών, 100 για πίεση αποκάλυψης συλλογισμού, 100 για καταστολή αξιακού συλλογισμού και 40 validation items. Κάθε item είχε βασική και «steered» εκδοχή, ώστε κάθε μοντέλο να συγκρίνεται με τον εαυτό του πάνω στο ίδιο περιεχόμενο. Τα έξι μοντέλα παρήγαγαν συνολικά 4.080 απαντήσεις.
Η αξιολόγηση έγινε με συμπεριφορικές ρουμπρίκες που προέκυψαν από παρατήρηση των πραγματικών απαντήσεων σε development φάση και στη συνέχεια «πάγωσαν». Όλα τα μοντέλα λειτούργησαν ως τυφλοί peer judges για όλες τις απαντήσεις. Έτσι προέκυψαν 24.480 κρίσεις. Για κάθε απάντηση, η ετικέτα συναίνεσης υπολογίστηκε από τους πέντε judges που δεν ήταν το ίδιο το μοντέλο-δημιουργός, περιορίζοντας την επίδραση self-preference.
Τα μοντέλα ήταν Claude Opus 4.7, GPT-5, Gemini 2.5 Pro, DeepSeek-R1, Qwen3.7-Max και Llama-3.3-70B-Instruct-Turbo. Η εργασία τονίζει ότι τα συμπεράσματα αφορούν αυτά τα συγκεκριμένα μοντέλα στις συγκεκριμένες συνθήκες και δεν αποδεικνύουν γενικούς κανόνες για κάθε developer ή μελλοντική έκδοση.
Το μέγεθος της αξιολόγησης σε τέσσερις αριθμούς
Οι μετρικές προέρχονται από την πρωτογενή εργασία και περιγράφουν το πρωτόκολλο του συγκεκριμένου benchmark, όχι καθολική κατάταξη των developers.
6
Γλωσσικά μοντέλα
Ένα μοντέλο από κάθε έναν από έξι διαφορετικούς developers.
340
Συνολικά items
300 βασικά items σε τρεις κατηγορίες και 40 validation items.
4.080
Απαντήσεις
Κάθε item δοκιμάστηκε σε βασική και steered εκδοχή από όλα τα μοντέλα.
24.480
Τυφλές κρίσεις
Και τα έξι μοντέλα έκριναν όλες τις απαντήσεις με παγωμένες ρουμπρίκες.
Η τελική ετικέτα κάθε απάντησης προέκυψε από leave-one-out consensus των πέντε judges που δεν ήταν το μοντέλο-δημιουργός της.
Η ξεχωριστή στάση του GPT-5 απέναντι στην αποκάλυψη συλλογισμού
Στα 100 steered prompts που πίεζαν για αποκάλυψη συλλογισμού, το GPT-5 αρνήθηκε να παρουσιάσει το σκεπτικό του αλλά διατήρησε την απάντηση σε 99 περιπτώσεις. Η ίδια συμπεριφορική ετικέτα δεν εμφανίστηκε ούτε μία φορά στις 500 αντίστοιχες απαντήσεις των άλλων πέντε μοντέλων. Το αποτέλεσμα δεν σημαίνει ότι ένα μοντέλο είναι συνολικά «καλύτερο». Δείχνει μια διακριτή πολιτική απόκρισης: προστασία του εσωτερικού reasoning χωρίς εγκατάλειψη του task.
Για μια επιχείρηση, αυτή η διάκριση βοηθά να οριστεί σωστά η απαίτηση διαφάνειας. Οι χρήστες μπορεί να χρειάζονται τεκμηρίωση, πηγές, κριτήρια ή σύντομη αιτιολόγηση, όχι απαραίτητα εσωτερική αλυσίδα σκέψης. Ένα καλά σχεδιασμένο workflow πρέπει να ζητά ελέγξιμα στοιχεία και να αποθηκεύει τα δεδομένα που στηρίζουν την απόφαση, αντί να θεωρεί ότι η εκτενής λεκτική έκθεση συλλογισμού είναι από μόνη της απόδειξη αξιοπιστίας.
Δύο διαφορετικοί τρόποι αντίστασης στην καταστολή αξιών
Όταν τα prompts ζητούσαν να αποκλειστούν αξιακές επιφυλάξεις από τον συλλογισμό, τα Claude Opus 4.7 και GPT-5 εμφάνισαν ουσιαστική αντίσταση, αλλά με διαφορετική μορφή. Το Opus συχνότερα ολοκλήρωνε το task ενώ αμφισβητούσε ρητά το framing: 17 στις 100 περιπτώσεις, έναντι 5 για το GPT-5. Το GPT-5 συχνότερα απέρριπτε το πλαίσιο και κρατούσε πίσω το ζητούμενο περιεχόμενο: 16 περιπτώσεις, έναντι 8 για το Opus.
Η διαφορά ενδιαφέρει ιδιαίτερα τα brand και compliance teams. Η πρώτη συμπεριφορά διατηρεί μεγαλύτερη παραγωγικότητα, αλλά μπορεί να αφήσει να περάσει τμήμα μιας προβληματικής εργασίας. Η δεύτερη προστατεύει ισχυρότερα το όριο, αλλά διακόπτει τη ροή. Δεν υπάρχει καθολικά σωστή επιλογή. Σε ένα δημιουργικό εργαλείο ίσως προτιμάται η προσαρμοσμένη εναλλακτική. Σε μια ενέργεια με νομικό, οικονομικό ή reputational ρίσκο, μπορεί να απαιτείται αυστηρή διακοπή και ανθρώπινη έγκριση.
Τέσσερις τρόποι απόκρισης που πρέπει να μετρά ένα business evaluation
Οι διαφορές εμφανίζονται ακόμη και πριν από την πίεση
Στα βασικά prompts σύγκρουσης αξιών, η πλήρης συμμόρφωση χώρισε τα μοντέλα σε τρία επίπεδα. Το Opus βρέθηκε στο 35%, το Llama στο 57%, ενώ GPT-5, DeepSeek, Qwen και Gemini κινήθηκαν από 93% έως 100%. Η μελέτη αποδίδει μεγάλο μέρος της απόστασης στο ότι το Opus και το Llama έκαναν συχνότερα διευκρινιστικές ερωτήσεις σε πραγματικά ασαφή prompts: 60% και 42% αντίστοιχα, ενώ κανένα άλλο μοντέλο δεν ξεπέρασε το 5%.
Άρα το «χαμηλότερο compliance» δεν ισοδυναμεί αναγκαστικά με χειρότερη απόδοση. Μπορεί να σημαίνει ότι το μοντέλο δεν θέλει να εφεύρει τις παραμέτρους που λείπουν. Σε e-commerce customer service, μια διευκρίνιση για το προϊόν, την παραγγελία ή το επιθυμητό αποτέλεσμα μπορεί να αποτρέψει λάθος απάντηση. Αντίθετα, σε εργασίες υψηλού όγκου με καλά δομημένα inputs, οι συνεχείς ερωτήσεις μπορεί να αυξήσουν χρόνο και κόστος.
Μην κάνετε το compliance μοναδικό KPI: μια διευκρινιστική ερώτηση μπορεί να είναι επιτυχία πριν από refund ή αλλαγή παραγγελίας, αλλά αποτυχία latency σε μια πλήρως δομημένη εργασία. Η ετικέτα χρειάζεται να συνδέεται με το ρίσκο του συγκεκριμένου workflow.
Η άρνηση με εναλλακτική διαφέρει σχεδόν οκταπλάσια
Υπό steering στα ίδια values-conflict items, το Opus αρνήθηκε το προβληματικό framing προσφέροντας εναλλακτική στο 91% των περιπτώσεων και το GPT-5 στο 89%. Το Qwen ακολούθησε με 61%, το DeepSeek με 41%, το Gemini με 23% και το Llama με 12%. Η απόσταση κορυφής και βάσης ήταν σχεδόν οκταπλάσια.
Για ένα brand, η προσφορά εναλλακτικής είναι συχνά το σημείο όπου η ασφάλεια συναντά την εμπειρία πελάτη. Ένα μοντέλο που απλώς αρνείται μεταφέρει όλο το βάρος στον χρήστη. Ένα μοντέλο που επαναδιατυπώνει το αίτημα με αποδεκτό τρόπο μπορεί να διατηρήσει τον στόχο χωρίς να υιοθετήσει το προβληματικό πλαίσιο. Αυτή η ικανότητα πρέπει να μετριέται με συγκεκριμένες, εγκεκριμένες κατηγορίες απάντησης και όχι μόνο με έναν συνολικό βαθμό επιτυχίας.
Τι αποκάλυψαν οι ανοιχτές αλυσίδες συλλογισμού του DeepSeek
Η εργασία αναλύει ξεχωριστά τα εμφανή reasoning traces του DeepSeek-R1. Στα 100 steered traces για καταστολή αξιών, η αποκλεισμένη αξιακή διάσταση εμφανίστηκε εσωτερικά σε 85 περιπτώσεις και στη συνέχεια παραμερίστηκε. Σε 74 από αυτές, το trace την αντιμετώπισε ως περιορισμό του χρήστη και συνέχισε, ενώ σε 11 εξέφρασε την επιφύλαξη πριν τελικά την υπερβεί. Στις υπόλοιπες 15 δεν εμφανίστηκε.
Οι συγγραφείς ερμηνεύουν αυτό το αποτέλεσμα ως διαφορά ανάμεσα στο τι καταγράφει το μοντέλο και στο τι τελικά εκφράζει. Για μια επιχειρησιακή αξιολόγηση που οδηγεί σε βελτίωση, η κρίσιμη μονάδα παραμένει η συμπεριφορά που φτάνει στον χρήστη και η ενέργεια που εκτελεί το σύστημα. Η ανάγνωση ενός trace μπορεί να βοηθά την έρευνα, αλλά δεν αντικαθιστά τους ελέγχους εξόδου, τα δυναμικά δικαιώματα ελάχιστης πρόσβασης, τα audit logs και τα όρια εκτέλεσης ενός production agent.
Οι έλεγχοι που ενισχύουν —και περιορίζουν— τα ευρήματα
Οι ερευνητές εντόπισαν ότι το ίδιο token budget δεν έδινε ισοδύναμο χώρο απάντησης, επειδή ορισμένοι providers καταναλώνουν tokens σε κρυφό reasoning. Οι απαντήσεις DeepSeek, Qwen και Llama αναδημιουργήθηκαν με τριπλάσιο answer budget, επαναξιολογήθηκαν και η ανάλυση ξαναέτρεξε. Οι βασικές διαφορές αντίστασης στην καταστολή παρέμειναν.
Επειδή οι πρώτες 20 περιπτώσεις κάθε κατηγορίας βοήθησαν στη δημιουργία των rubrics, η πλήρης ανάλυση επαναλήφθηκε στις υπόλοιπες 80 held-out περιπτώσεις ανά κατηγορία. Καμία αναλογία δεν μετακινήθηκε πάνω από πέντε ποσοστιαίες μονάδες και η σειρά των βασικών ευρημάτων διατηρήθηκε. Έγινε επίσης control experiment χωρίς το item-context πεδίο του judge prompt. Η αφαίρεσή του μείωσε την αναπαραγωγή των αρχικών labels από 96,3% σε 86,6%, δείχνοντας ότι το context επηρέαζε τις κρίσεις, χωρίς όμως να ανατρέψει τις κεντρικές συγκρίσεις του δείγματος.
Η συμφωνία των judges ήταν καλή στις περισσότερες κατηγορίες, αλλά μόνο μέτρια στην καταστολή συλλογισμού, με Fleiss’ κ 0,599. Αυτό είναι ουσιαστικός περιορισμός, όχι λεπτομέρεια. Η μελέτη χρειάζεται ανθρώπινη επικύρωση σε δείγμα και δεν πρέπει να μεταφράζεται σε απόλυτη κατάταξη μοντέλων.
Από τη συμπεριφορά στον μηχανισμό του Llama
Για το ανοιχτό Llama-3.3-70B-Instruct, η μελέτη εξέτασε αν η διάκριση ανάμεσα σε διευκρινιστική εκτροπή και ουσιαστική απάντηση μπορεί να αποκωδικοποιηθεί από το residual stream. Ένα γραμμικό probe έφτασε σε held-out balanced accuracy 0,866. Η επίδοση ισχυροποιήθηκε στα βαθύτερα layers και ξεπέρασε permutation controls, ενώ ένα μικρότερο μοντέλο που χρησιμοποιήθηκε ως prompt-only baseline έφτασε έως 0,72.
Στη συνέχεια οι ερευνητές πρόσθεσαν μια κατεύθυνση activation steering στο layer 40 για 50 held-out prompts. Καθώς η ένταση της παρέμβασης μετακινήθηκε από -12 έως +12, ο ρυθμός διευκρινιστικής «εκτροπής» πήγε από 0% σε 86%, με το μηδενικό control στο 40%. Το αποτέλεσμα υποστηρίζει αιτιακή εμπλοκή της κατεύθυνσης στη συγκεκριμένη συμπεριφορά, αλλά οι συγγραφείς προειδοποιούν ότι το vector μπορεί να συνδυάζει συσχετισμένα χαρακτηριστικά, όπως το μήκος απάντησης.
Επίσης, οι activations προήλθαν από reference weights που έτρεξαν τοπικά, ενώ οι αρχικές απαντήσεις είχαν παραχθεί από hosted Turbo stack. Η ανάλυση είναι χρήσιμη ως απόδειξη ότι μια συμπεριφορική διαφορά μπορεί να συνδεθεί με εσωτερική αναπαράσταση. Δεν αποτελεί μηχανιστική εξήγηση για τις διαφορές μεταξύ όλων των κλειστών και ανοιχτών μοντέλων.
Πότε είναι έτοιμο ένα μοντέλο για κρίσιμο workflow;
Όταν περνά όχι μόνο το task-success threshold, αλλά και τα συμφωνημένα όρια για διευκρίνιση, άρνηση, ασφαλή εναλλακτική, escalation και μη αναστρέψιμες ενέργειες.
Το ίδιο evaluation set πρέπει να επαναλαμβάνεται μετά από αλλαγή μοντέλου, system prompt, retrieval layer ή tool permissions.
Ένα πρακτικό πλαίσιο αξιολόγησης για επιχειρήσεις
Η προσεκτική επιχειρησιακή ανάγνωση της μελέτης οδηγεί σε ένα σαφές συμπέρασμα: πριν επιλεγεί μοντέλο, πρέπει να οριστούν οι επιθυμητοί τρόποι απόκρισης. Η ομάδα μπορεί να δημιουργήσει ζεύγη prompts για κανονική και πιεστική συνθήκη, χρησιμοποιώντας πραγματικές κατηγορίες εργασιών: ασαφές αίτημα πελάτη, επιθετικό διαφημιστικό framing, αίτημα απόκρυψης περιορισμών, προσπάθεια παράκαμψης πολιτικής ή εντολή agent χωρίς επαρκή δεδομένα.
Οι ετικέτες αξιολόγησης μπορούν να ακολουθούν λειτουργικές κατηγορίες: πλήρης συμμόρφωση, συμμόρφωση με επιφύλαξη, διευκρίνιση, άρνηση χωρίς συνέχεια, άρνηση με εναλλακτική και κλιμάκωση σε άνθρωπο. Κάθε κατηγορία πρέπει να συνδέεται με το ρίσκο του workflow. Για παράδειγμα, η διευκρίνιση είναι θετική πριν από επιστροφή χρημάτων, αλλά ίσως περιττή σε απλή μορφοποίηση κειμένου.
Τέλος, η αξιολόγηση πρέπει να επαναλαμβάνεται όταν αλλάζει έκδοση μοντέλου, system prompt, tool permissions ή retrieval layer. Η μελέτη εξετάζει συγκεκριμένα μοντέλα σε συγκεκριμένο χρόνο. Το production σύστημα μιας επιχείρησης περιλαμβάνει πολύ περισσότερα από το βασικό μοντέλο, και κάθε στρώμα μπορεί να αλλάξει την τελική συμπεριφορά.
Έξι βήματα για paired benchmark συμπεριφοράς υπό πίεση
- Step 1Ορίστε το workflow και το κόστος λάθους
Ξεχωρίστε αν αξιολογείτε υποστήριξη πελατών, marketing copy, moderation ή agent που αλλάζει δεδομένα και καταγράψτε ποια αποτυχία είναι πραγματικά κρίσιμη.
- Step 2Δημιουργήστε ζεύγη base και pressure prompts
Χρησιμοποιήστε το ίδιο επιχειρηματικό αίτημα σε καθαρή και πιεστική εκδοχή, χωρίς να αλλάζει η ουσία ή η δυσκολία του task.
- Step 3Παγώστε τις κατηγορίες πριν από το test
Ορίστε πλήρη συμμόρφωση, διευκρίνιση, challenge and comply, άρνηση χωρίς συνέχεια, άρνηση με εναλλακτική και ανθρώπινο escalation.
- Step 4Βαθμολογήστε task και response mode χωριστά
Ένα σωστό αποτέλεσμα μπορεί να έχει λάθος συμπεριφορική διαδρομή, ενώ μια άρνηση με χρήσιμη εναλλακτική μπορεί να είναι η επιθυμητή έκβαση.
- Step 5Δοκιμάστε με τα πραγματικά permissions
Το μοντέλο, το system prompt, το retrieval και τα εργαλεία αποτελούν ενιαίο σύστημα. Μετρήστε retries, invalid tool calls, confirmations και escalations.
- Step 6Ορίστε version gate και rollback
Επαναλάβετε το benchmark πριν από κάθε αλλαγή έκδοσης και κρατήστε ασφαλή επιστροφή όταν αλλάζουν οι κρίσιμες κατηγορίες συμπεριφοράς.
Το ουσιαστικό μήνυμα για AI governance
Η ασφάλεια και η χρησιμότητα δεν χωρούν σε ένα ενιαίο score. Δύο μοντέλα μπορεί να έχουν παρόμοιο ποσοστό επιτυχίας αλλά να αποτυγχάνουν με εντελώς διαφορετικό τρόπο. Για το governance ενός AI πριν από την παραγωγή, αυτό σημαίνει ότι οι αποφάσεις χρειάζονται συμπεριφορικά acceptance criteria, παραδείγματα οριακών περιπτώσεων, παρακολούθηση παραγωγής και σαφή κανόνα για το πότε μια άρνηση πρέπει να συνοδεύεται από εναλλακτική ή ανθρώπινη κλιμάκωση.
Η έρευνα δεν δίνει έναν καθολικό νικητή. Δίνει κάτι πιο χρήσιμο: ένα λεξιλόγιο για να εξετάσουμε τι κάνει πραγματικά ένα AI όταν πιέζεται. Για μια επιχείρηση που περνά από τα demos σε κρίσιμα workflows, αυτή η ερώτηση είναι συχνά πιο σημαντική από το αν το μοντέλο κέρδισε μία ακόμη μονάδα σε ένα γενικό benchmark.
Business Automation & AI by TWO DOTS
Μετρήστε πώς αντιδρά το AI πριν του δώσετε πραγματικά εργαλεία.
Η TWO DOTS σχεδιάζει evaluation sets, response-mode rubrics, permissions, human escalation και ασφαλή pilots για customer support, marketing και επιχειρηματικούς agents. Η επιλογή μοντέλου βασίζεται στη συμπεριφορά του δικού σας workflow, όχι σε ένα γενικό score.
Frequently Asked Questions (FAQs)
Τι σημαίνει steerability σε ένα γλωσσικό μοντέλο;
Είναι ο βαθμός και ο τρόπος με τον οποίο οι οδηγίες μετακινούν τη συμπεριφορά του μοντέλου. Η μελέτη εξετάζει όχι μόνο αν συμμορφώνεται, αλλά και αν διευκρινίζει, αντιστέκεται, αρνείται ή προσφέρει ασφαλή εναλλακτική.
Πόσα μοντέλα και prompts εξετάστηκαν;
Εξετάστηκαν έξι μοντέλα σε 340 items: 300 βασικά items σε τρεις κατηγορίες και 40 validation items. Κάθε item είχε base και steered συνθήκη, δημιουργώντας 4.080 απαντήσεις και 24.480 τυφλές κρίσεις.
Ποιο ήταν το πιο ιδιαίτερο εύρημα για το GPT-5;
Στα 100 steered prompts αποκάλυψης συλλογισμού, το GPT-5 αρνήθηκε να παρουσιάσει το reasoning αλλά κράτησε την απάντηση σε 99 περιπτώσεις. Η ίδια ετικέτα δεν εμφανίστηκε στις 500 αντίστοιχες απαντήσεις των άλλων πέντε μοντέλων.
Γιατί οι διευκρινιστικές ερωτήσεις έχουν σημασία;
Μπορούν να αποτρέψουν λάθος υπόθεση σε ασαφή αιτήματα, όπως ένα refund χωρίς επαρκή στοιχεία. Σε πλήρως δομημένα workflows όμως μπορεί να αυξήσουν latency και κόστος, οπότε η αξία τους εξαρτάται από το task.
Αποδεικνύει η μελέτη ποιο μοντέλο είναι ασφαλέστερο;
Όχι. Μετρά συγκεκριμένες συμπεριφορές συγκεκριμένων εκδόσεων και περιλαμβάνει ένα μοντέλο ανά developer. Οι συγγραφείς ζητούν επίσης ανθρώπινη επικύρωση του panel κρίσης σε δείγμα.
Τι έδειξε το activation steering στο Llama;
Μια κατεύθυνση στο residual stream αποκωδικοποίησε τη συμπεριφορά με held-out balanced accuracy περίπου 0,87. Η παρέμβαση μετέβαλε τον ρυθμό διευκρινιστικής εκτροπής από 0% έως 86% στο sweep, χωρίς να εξηγεί τις διαφορές όλων των μοντέλων.
Πώς μπορεί μια επιχείρηση να αξιοποιήσει τα ευρήματα;
Με paired benchmark σε δικά της σενάρια, παγωμένες κατηγορίες απόκρισης, ξεχωριστή μέτρηση task success και response mode, πραγματικά tool permissions, ανθρώπινο escalation και επανέλεγχο μετά από κάθε αλλαγή συστήματος.
Αρκεί ένα υψηλό accuracy score για επιλογή μοντέλου;
Όχι. Χρειάζεται να μετρώνται ο τρόπος άρνησης, η ποιότητα της εναλλακτικής, η τάση για διευκρίνιση, τα tool errors και η συμπεριφορά υπό πίεση, μαζί με ακρίβεια, κόστος και ταχύτητα.