Σύντομη απάντηση: η εργασία βρίσκει ότι τα RL-oriented reasoning models τείνουν να σχηματίζουν πιο καθαρά, νωρίτερα ανιχνεύσιμα representations της ορθότητας και να συγκεντρώνουν κρίσιμη επεξεργασία σε βαθύτερα layers. Δεν βρίσκει, όμως, ότι το RL εγγυάται σταθερό μήκος απάντησης ή προβλέψιμο compute.
Αυτό είναι το ουσιαστικό μήνυμα για μια επιχείρηση: μην αγοράζετε την ετικέτα «reasoning» ή «RL». Αξιολογήστε το συγκεκριμένο model version στο δικό σας workload, με ίδιο prompt και sampling, επαναλαμβανόμενα runs και κοινές μετρήσεις για ποιότητα, latency, tokens και κόστος.
Το κρίσιμο εύρημα: τα internal representations και η κατανομή της δουλειάς στα layers διαφέρουν μεταξύ RL-oriented και SFT/instruction-tuned μοντέλων, αλλά η σταθερότητα των output tokens παραμένει ιδιότητα ολόκληρου του training και deployment pipeline.
Τι συγκρίνει πραγματικά η μελέτη
Η εργασία Probing the Origins of Reasoning Performance δεν περιορίζεται σε ένα ακόμη benchmark score. Ρωτά αν η μέθοδος εκπαίδευσης αλλάζει τον τρόπο με τον οποίο ένα μοντέλο οργανώνει εσωτερικά την πληροφορία, κατανέμει τον υπολογισμό στα transformer layers και αποφασίζει πόσο μεγάλη απάντηση θα παράγει.
Οι συγγραφείς συγκρίνουν παραλλαγές των οικογενειών DeepSeek-Math και Olmo 3 με τρεις συμπληρωματικές προσεγγίσεις: linear probes στα layer-wise hidden states, mean ablations ανά layer και επαναλαμβανόμενες δειγματοληψίες για τη μεταβλητότητα των output tokens. Το αποτέλεσμα δεν είναι ένα απλοϊκό «RL καλό, SFT κακό». Τα RL-oriented μοντέλα εμφανίζουν καθαρότερα correctness signals, ενώ η σταθερότητα του μήκους διαφέρει έντονα ανά model family.
Αυτή η διάκριση συμπληρώνει όσα βλέπουμε όταν ένα μοντέλο παράγει περισσότερο reasoning χωρίς ανάλογη βελτίωση. Η μεγαλύτερη αλυσίδα σκέψης δεν είναι από μόνη της απόδειξη καλύτερης εσωτερικής οργάνωσης ή καλύτερης επιχειρηματικής απόδοσης.
Τέσσερις διαστάσεις της σύγκρισης RL και SFT
Πώς στήθηκε το probing των hidden states
Για το probing δημιουργήθηκαν 1.000 συνθετικά μαθηματικά προβλήματα με ελεγχόμενες αριθμητικές παραμέτρους. Η συνθετική παραγωγή μειώνει τον κίνδυνο contamination, επιτρέπει αλγοριθμικό έλεγχο του ground truth και δίνει αρκετά δείγματα για στατιστική ανάλυση. Δεν αποδεικνύει γενίκευση σε κάθε είδος reasoning, αλλά απομονώνει καλύτερα το φαινόμενο που εξετάζεται.
Κάθε μοντέλο παρήγαγε μία απάντηση ανά πρόβλημα με temperature 0,6–0,7 και top-p 0,95. Η τελική τιμή εξαγόταν από το boxed delimiter και επιτρεπόταν ανοχή ±1 για στρογγυλοποίηση. Οι ερευνητές κράτησαν το κοινό σύνολο προβλημάτων που απαντήθηκε από όλα τα μοντέλα, εξισορρόπησαν σωστά και λανθασμένα δείγματα και χρησιμοποίησαν διαχωρισμό 70% training, 15% validation και 15% test.
Τα activations συλλέχθηκαν ακριβώς πριν από το delimiter της τελικής απάντησης, δηλαδή αφού είχε παραχθεί το reasoning αλλά πριν εκφραστεί ο αριθμός. Για κάθε layer εκπαιδεύτηκε logistic regression με 5-fold cross-validation. Η απλότητα του probe είναι σημαντική: αν ένας γραμμικός classifier διαχωρίζει αξιόπιστα σωστές και λανθασμένες λύσεις, η σχετική πληροφορία είναι πιο καθαρά linearly separable.
Τι έδειξαν τα linear probes
Σύμφωνα με το Figure 1, τα DeepSeek-Math-7B-RL και Olmo-3-Think πέτυχαν probe accuracy 83%–98%, ενώ τα instruction-tuned μοντέλα κινήθηκαν στο 75%–90%. Η εργασία αναφέρει διαφορά οκτώ ποσοστιαίων μονάδων και μικρότερη διακύμανση μεταξύ δειγμάτων για τα reasoning μοντέλα.
Η πληροφορία περί ορθότητας εμφανίστηκε επίσης νωρίτερα. Στο layer 0 η test accuracy ήταν περίπου 70% για τα reasoning-capable μοντέλα και 65% για τα Instruct. Τα Olmo-3-Think και DeepSeek-Math-7B-RL διατήρησαν περίπου 94%–95% στα layers 15–29.
Η ερμηνεία χρειάζεται φρένο. Ένα linear probe αποδεικνύει ότι ένα signal μπορεί να εξαχθεί από το hidden state· δεν αποδεικνύει ότι το συγκεκριμένο layer ή το ίδιο το signal προκάλεσε τη σωστή λύση. Για αυτό η εργασία προσθέτει παρεμβάσεις mean ablation και δεν μένει σε μια περιγραφική συσχέτιση. Παρόμοια, η διαθεσιμότητα σωστής πληροφορίας μέσα στο μοντέλο δεν σημαίνει ότι θα χρησιμοποιηθεί σωστά σε κάθε παραγωγή.
Οι μετρήσεις που στηρίζουν τα βασικά συμπεράσματα
Οι τιμές ανήκουν στο συγκεκριμένο ερευνητικό πρωτόκολλο και δεν αποτελούν γενικό score ποιότητας για κάθε reasoning model.
1.000συνθετικά προβλήματα
Χρησιμοποιήθηκαν για το layer-wise probing με ελεγχόμενη παραγωγή και αλγοριθμικό ground truth.
83%–98%probe accuracy
Το εύρος που αναφέρει η εργασία για τα RL-oriented reasoning models.
r=0,47συσχέτιση βάθους
Η θετική σχέση layer depth και accuracy drop στο DeepSeek-Math-7B-RL, με p<0,01.
CV≈1,3μέγιστη μεταβλητότητα
Η κορυφή του token coefficient of variation για το DeepSeek-Math-RL στη ζώνη 40%–60% accuracy.
Mean ablation: ποια layers αλλάζουν το αποτέλεσμα
Το probing δείχνει ότι μια πληροφορία είναι διαθέσιμη. Η mean ablation εξετάζει αν η συνεισφορά ενός layer είναι λειτουργικά σημαντική: αντικαθιστά τα activations του με τη μέση ενεργοποίηση από dataset αναφοράς και μετρά την πτώση ακρίβειας. Η δοκιμή έγινε σε 20 προβλήματα GSM8K για τα DeepSeek-Math-7B-RL και DeepSeek-Math-7B-Instruct.
Η βασική ακρίβεια ήταν 70% για το RL μοντέλο και 65% για το Instruct. Στο RL, η συσχέτιση μεταξύ βάθους layer και επίδρασης της παρέμβασης ήταν θετική, r=0,47 με p<0,01. Στο Instruct ήταν r=-0,11 με p=0,55. Το πρώτο μοτίβο δείχνει ότι τα βαθύτερα layers γίνονται προοδευτικά πιο κρίσιμα, ενώ το δεύτερο ταιριάζει σε πιο επίπεδη κατανομή σημασίας.
Η συγκέντρωση κρίσιμης επεξεργασίας εμφανίστηκε κυρίως στα layers 9–18 και 22–26 του RL μοντέλου. Μέχρι το layer 10 τα δύο μοντέλα είχαν παρόμοια ευπάθεια, αλλά μετά το layer 15 οι τροχιές αποκλίνουν. Οι συγγραφείς το ερμηνεύουν ως πιο ιεραρχική οργάνωση στο RL και πιο κατανεμημένη, πλεονάζουσα επεξεργασία στο instruction-tuned μοντέλο.
Token variability: γιατί περισσότερα tokens δεν σημαίνουν καλύτερη κατανομή
Η τρίτη ανάλυση χρησιμοποιεί 50 προβλήματα από το GSM8K-Platinum και 50 ανεξάρτητες απαντήσεις ανά πρόβλημα και μοντέλο. Μετρά answer consistency, διάμεσο output tokens και coefficient of variation, δηλαδή την τυπική απόκλιση διαιρεμένη με τον μέσο αριθμό tokens.
Ο CV επιτρέπει σύγκριση μοντέλων με πολύ διαφορετικό μήκος εξόδου, καθώς τα reasoning models στην εργασία παρήγαγαν συνήθως 5–10 φορές περισσότερα tokens από τα SFT. Το ζητούμενο δεν είναι αν ένα μοντέλο γράφει περισσότερο, αλλά αν κατανέμει με σταθερό τρόπο το computational effort όταν βλέπει ξανά το ίδιο πρόβλημα.
Το DeepSeek-Math-RL έφτασε CV περίπου 1,3 στη ζώνη accuracy 40%–60%, περίπου 0,95 στη ζώνη 0%–20% και περίπου 0,35 στη ζώνη 80%–100%. Το DeepSeek-Math-Instruct είχε χαμηλότερη μεταβλητότητα. Αντίθετα, τα Olmo-3-Think και Olmo-3-Instruct διατήρησαν CV 0,1–0,125 όπου υπήρχαν δεδομένα.
Άρα το RL δεν εγγυάται προβλέψιμη adaptive compute allocation. Reward structure, δεδομένα, decoding και ολόκληρο το pipeline μπορούν να υπερισχύσουν της ετικέτας εκπαίδευσης. Σε παραγωγικά συστήματα, αυτό συνδέεται άμεσα με routing που συνυπολογίζει latency, accuracy και κόστος.
Το αριθμητικό κενό που χρειάζεται προσοχή
Η εργασία γράφει ότι αξιολογήθηκαν 50 προβλήματα, με 50 ανεξάρτητες απαντήσεις ανά πρόβλημα και μοντέλο. Αυτό αντιστοιχεί σε 2.500 responses ανά model. Στην ίδια παράγραφο αναφέρεται σύνολο 15.000 responses ανά model, αριθμός που δεν προκύπτει από τον δηλωμένο πολλαπλασιασμό.
Για αυτό το άρθρο κρατά το επαληθεύσιμο πρωτόκολλο των 50 × 50 και δεν χρησιμοποιεί το ασύμβατο σύνολο ως metric. Η απόκλιση δεν ακυρώνει αυτομάτως τα γραφήματα, αλλά μειώνει τη βεβαιότητα για το ακριβές πλήθος εκτελέσεων μέχρι να υπάρξει διόρθωση ή επιπλέον τεκμηρίωση από τους συγγραφείς.
Αυτό είναι πρακτικό μάθημα για κάθε benchmark: ελέγξτε αν τα totals συμφωνούν με το sampling plan και αν οι πίνακες μπορούν να αναπαραχθούν. Η διαφάνεια στα AI benchmarks είναι μέρος της ποιότητας, όχι τυπική υποσημείωση.
Κανόνας ανάγνωσης benchmark
Όταν το αναφερόμενο σύνολο δεν συμφωνεί με το πρωτόκολλο, δημοσιεύστε τη διαφορά και στηρίξτε το συμπέρασμα μόνο στα επαληθεύσιμα μεγέθη.
Η προσεκτική τεκμηρίωση προστατεύει την επιχειρηματική απόφαση από εντυπωσιακούς αλλά ασύμβατους αριθμούς.
Τι σημαίνουν τα ευρήματα για AI procurement
Για μια ομάδα e-commerce, marketing ή customer support, το συμπέρασμα δεν είναι να ζητήσει hidden-state probes πριν αγοράσει ένα εργαλείο. Είναι να μην αντιμετωπίζει το benchmark score ως πλήρη περιγραφή ποιότητας. Ένα μοντέλο μπορεί να πετυχαίνει υψηλή accuracy, αλλά να παρουσιάζει μεγάλη διακύμανση σε latency, output length και token cost.
Η πραγματική μονάδα αξιολόγησης είναι το συγκεκριμένο model version μαζί με prompt, sampling settings, εργαλεία και deployment stack. Οι όροι RL, SFT, Thinking και Instruct είναι χρήσιμες ετικέτες προέλευσης, όχι εγγύηση συμπεριφοράς. Αυτός είναι και ο λόγος που κανένα AI μοντέλο δεν πρέπει να γίνεται μόνιμο στοίχημα χωρίς συνεχή σύγκριση.
Μετρήστε επαναλαμβανόμενα runs στο ίδιο input, όχι μόνο διαφορετικά test cases. Χρησιμοποιήστε πραγματικά tasks: κατηγοριοποίηση αιτημάτων, έλεγχο πολιτικών, δημιουργία briefs, σύνοψη παραγγελιών ή ανάλυση καταλόγου. Η μαθηματική μελέτη δεν αποδεικνύει ότι τα findings μεταφέρονται αυτούσια σε αυτά τα πεδία, αλλά δίνει ισχυρή μεθοδολογική κατεύθυνση.
Πώς να αξιολογήσετε ένα reasoning model στην πράξη
Η ασφαλής διαδικασία συνδυάζει εξωτερική επίδοση και λειτουργική σταθερότητα. Το NIST AI RMF οργανώνει τη διαχείριση γύρω από Govern, Map, Measure και Manage και τονίζει ότι η μέτρηση πρέπει να συνδέεται με το πραγματικό context χρήσης, το business value, τα όρια και το human oversight.
Έξι βήματα για αξιολόγηση reasoning models σε πραγματικό workload
- Βήμα 1Ορίστε το επιχειρηματικό αποτέλεσμα
Περιγράψτε το task, το αποδεκτό λάθος, το SLA και το κόστος μιας λανθασμένης απάντησης πριν συγκρίνετε μοντέλα.
- Βήμα 2Κλειδώστε ολόκληρη τη συνταγή
Καταγράψτε ακριβές model version, system prompt, εργαλεία, temperature, top-p, όρια tokens και υποδομή εκτέλεσης.
- Βήμα 3Χωρίστε selection και reporting set
Επιλέξτε ρυθμίσεις σε ένα σύνολο και αναφέρετε το τελικό αποτέλεσμα σε διαφορετικά, αθέατα παραδείγματα του ίδιου workload.
- Βήμα 4Επαναλάβετε το ίδιο input
Τρέξτε κάθε κρίσιμο case πολλές φορές ώστε να μετρήσετε τη διακύμανση και όχι μόνο μια ευνοϊκή απάντηση.
- Βήμα 5Μετρήστε ποιότητα και λειτουργία μαζί
Παρακολουθήστε accuracy, failure rate, latency, output tokens, κόστος και coefficient of variation ανά κατηγορία δυσκολίας.
- Βήμα 6Ορίστε go/no-go και επανέλεγχο
Θέστε όρια αποδοχής, human review για υψηλό αντίκτυπο και νέα αξιολόγηση όταν αλλάζει μοντέλο, prompt ή deployment stack.
Για agentic workflows, προσθέστε δικαιώματα ελάχιστης πρόσβασης, audit trail, fallback και δυνατότητα παύσης. Όταν το σύστημα μαθαίνει ή ενεργεί με πολιτικές reinforcement learning, η επαλήθευση της πολιτικής πριν από την παραγωγή είναι ξεχωριστό gate από την ποιότητα μιας μεμονωμένης απάντησης.
Τι δεν αποδεικνύει η εργασία
Τα probes χρειάζονται αρκετά ισορροπημένες σωστές και λανθασμένες απαντήσεις. Αν ένα μοντέλο απαντά σχεδόν πάντα σωστά ή σχεδόν πάντα λάθος, ο classifier κινδυνεύει να μάθει την πλειοψηφική κλάση. Τα συμπεράσματα είναι επομένως πιο αξιόπιστα κοντά στα όρια ικανότητας των μοντέλων.
Η mean-ablation ανάλυση καλύπτει δύο DeepSeek μοντέλα και μόνο 20 προβλήματα ανά μοντέλο. Το probing εστιάζει σε ελεγχόμενα μαθηματικά templates, όχι σε code generation, customer support ή εμπορικά workflows. Επίσης, ένα extractable signal δεν είναι από μόνο του αιτιακή απόδειξη.
Οι συγγραφείς προτείνουν επέκταση σε code generation και scientific reasoning, probing ενδιάμεσων βημάτων και real-time αξιολόγηση representation quality. Αυτά είναι μελλοντικές κατευθύνσεις. Δεν πρέπει να παρουσιαστούν ως ήδη επαληθευμένα προϊόντα monitoring.
Το ασφαλές επιχειρηματικό συμπέρασμα
Η εργασία προσφέρει δύο συγκλίνουσες ενδείξεις ότι η reasoning-oriented εκπαίδευση μπορεί να αναδομεί τον εσωτερικό υπολογισμό: καθαρότερα και νωρίτερα representations της ορθότητας, μαζί με μεγαλύτερη λειτουργική βαρύτητα στα βαθύτερα layers. Ταυτόχρονα, απορρίπτει την ιδέα ότι το RL εγγυάται σταθερή χρήση tokens.
Για μια επιχείρηση, η ώριμη αρχή είναι απλή: μην αγοράζετε training label. Αξιολογήστε το συγκεκριμένο σύστημα στις πραγματικές συνθήκες σας και μετρήστε όχι μόνο αν πέτυχε, αλλά πόσο σταθερά, πόσο γρήγορα και με πόσο κόστος πέτυχε. Η εσωτερική ερμηνευσιμότητα είναι πολύτιμη έρευνα· η επιχειρηματική απόφαση, όμως, χρειάζεται επαναλήψιμη εξωτερική απόδειξη.
Αυτοματισμοί επιχειρήσεων και AI από την TWO DOTS
Επιλέξτε reasoning model με δεδομένα από το δικό σας workload.
Η TWO DOTS σχεδιάζει AI αυτοματισμούς με ελεγχόμενα test sets, επαναλαμβανόμενα runs, παρακολούθηση latency και κόστους, validation gates και ανθρώπινη έγκριση όπου το ρίσκο το απαιτεί.
Често задавани въпроси
Ποια είναι η βασική διαφορά RL και SFT στη μελέτη;
Το SFT εκπαιδεύει πάνω σε παραδείγματα επιθυμητών απαντήσεων, ενώ οι RL-oriented παραλλαγές βελτιστοποιούνται με reward signals. Η εργασία συγκρίνει τις εσωτερικές και συμπεριφορικές συνέπειες αυτών των pipelines.
Τι μετρά ένα linear probe;
Μετρά πόσο εύκολα ένας απλός γραμμικός classifier μπορεί να ξεχωρίσει σωστές από λανθασμένες απαντήσεις χρησιμοποιώντας το hidden state ενός layer.
Η υψηλή probe accuracy αποδεικνύει αιτιακό reasoning;
Όχι. Δείχνει ότι η πληροφορία είναι linearly separable και εξαγώγιμη, όχι ότι το probe αποκάλυψε τον αιτιακό μηχανισμό που δημιούργησε την τελική απάντηση.
Τι έδειξε η mean ablation για τα layers;
Στο DeepSeek-Math-7B-RL τα βαθύτερα layers έγιναν προοδευτικά πιο κρίσιμα, ενώ στο DeepSeek-Math-7B-Instruct η σημασία ήταν πιο ομοιόμορφα κατανεμημένη.
Τα RL models χρησιμοποιούν πάντα πιο σταθερά τα tokens;
Όχι. Το DeepSeek-Math-RL είχε μεγαλύτερη μεταβλητότητα από το Instruct, ενώ τα Olmo-3-Think και Olmo-3-Instruct είχαν παρόμοια χαμηλή μεταβλητότητα.
Γιατί δεν χρησιμοποιείται ο αριθμός 15.000 responses ανά model;
Το πρωτόκολλο γράφει 50 προβλήματα και 50 απαντήσεις ανά πρόβλημα, δηλαδή 2.500 απαντήσεις ανά μοντέλο. Επειδή το αναφερόμενο σύνολο 15.000 δεν συμφωνεί με αυτόν τον πολλαπλασιασμό, το άρθρο κρατά το πρωτόκολλο και επισημαίνει την ασυνέπεια.
Μπορούν τα μαθηματικά ευρήματα να εφαρμοστούν άμεσα σε marketing ή e-commerce;
Όχι ως άμεση απόδειξη απόδοσης. Δίνουν όμως χρήσιμη μεθοδολογία: πραγματικά tasks, επαναλήψεις στο ίδιο input και κοινή μέτρηση ποιότητας, latency, tokens και κόστους.
Τι πρέπει να ζητήσει μια επιχείρηση πριν επιλέξει reasoning model;
Αποτελέσματα στο δικό της workload, σαφές model version, σταθερές ρυθμίσεις, επαναλαμβανόμενα runs, failure modes και διακύμανση σε latency και κόστος.