CompPO: όταν το Transformer καθοδηγεί πού πηγαίνει η ανταμοιβή

Το CompPO συνδέει το credit assignment στα LLM με την εσωτερική υπολογιστική διαδρομή του Transformer. Τι έδειξε, πού σταματούν τα στοιχεία και τι χρειάζεται ένα ασφαλές pilot.

Απάντηση πρώτα: το CompPO προτείνει το credit assignment ενός LLM να μην εξαρτάται μόνο από την απόσταση ανάμεσα στα tokens ή από ένα ενιαίο score για όλη την απάντηση. Χρησιμοποιεί ένα αποσυνδεδεμένο σήμα από την εσωτερική λειτουργία του Transformer για να ρυθμίσει πόσο μεταγενέστερο value περνά από κάθε μετάβαση.

Στο preprint Let Credit Follow Computation, η μέθοδος έφτασε 61,4% τελική held-out development accuracy έναντι 53,8% για ρυθμισμένο GRPO σε πέντε Qwen3-4B seeds. Το αποτέλεσμα είναι ισχυρό μέσα στο συγκεκριμένο μαθηματικό benchmark, αλλά δεν αποδεικνύει ταχύτερη εκπαίδευση, χαμηλότερο κόστος ή βελτίωση σε agents με εργαλεία, retrieval και εμπορικά workflows.

Съдържание

Το πρόβλημα πίσω από μια σωστή τελική απάντηση

Όταν ένα μεγάλο γλωσσικό μοντέλο λύνει ένα πρόβλημα πολλών βημάτων, η τελική επιτυχία δεν προκύπτει από όλα τα tokens με τον ίδιο τρόπο. Μια πρώιμη αντικατάσταση σε εξίσωση, η ανάκτηση του σωστού εγγράφου ή μια παρατήρηση που επηρεάζει μεταγενέστερο tool call μπορεί να καθορίσει ολόκληρη την απάντηση.

Το credit assignment απαντά στο δύσκολο ερώτημα: ποιες αποφάσεις αξίζουν επιβράβευση και ποιες ευθύνονται για το λάθος; Στα LLM το πρόβλημα γίνεται οξύτερο, επειδή ένας verifier μπορεί να επιστρέφει μόνο μία τελική ένδειξη επιτυχίας, ενώ η απάντηση αποτελείται από χιλιάδες αλληλεξαρτώμενες επιλογές.

Αν όλη η σωστή απάντηση επιβραβευτεί εξίσου, ενισχύονται και αδύναμα ή περιττά βήματα. Αν το σήμα μειώνεται μόνο με βάση την απόσταση, μπορεί να υποτιμηθεί ένα μακρινό αλλά κρίσιμο σημείο. Η ίδια διάκριση εμφανίζεται όταν εξετάζουμε ποιος ευθύνεται όταν ένας AI agent αποτυγχάνει: το τελικό outcome δεν αποκαλύπτει μόνο του σε ποιο βήμα γεννήθηκε η αστοχία.

Το CompPO δεν αλλάζει τον εξωτερικό reward ούτε τον clipped PPO στόχο. Αλλάζει τον τρόπο με τον οποίο το μεταγενέστερο evidence μεταφέρεται προς τα προηγούμενα tokens και συνδέει αυτή τη μεταφορά με την υπολογιστική διαδρομή που πραγματοποίησε η behavior policy.

Evidence, transport και update geometry

Οι Qifan Shi, Zhaolu Kang και Chenghua Zhu χωρίζουν τη διαδικασία μάθησης σε τρία αντικείμενα. Το evidence περιγράφει ότι μια ακολουθία ήταν καλή ή κακή: terminal reward, process reward, αξιολόγηση κριτή ή TD residual. Το transport καθορίζει πώς αυτή η πληροφορία μετατρέπεται σε token-level advantages. Το update geometry περιλαμβάνει clipping, importance ratios, KL περιορισμούς και normalization.

Ο διαχωρισμός είναι χρήσιμος επειδή δύο μέθοδοι μπορεί να βελτιώνουν διαφορετικά σημεία της ίδιας αλυσίδας. Ένας καλύτερος verifier βελτιώνει το evidence. Το GRPO αλλάζει τη baseline λογική και τη σύγκριση ανάμεσα σε απαντήσεις. Το PPO ορίζει τον τρόπο με τον οποίο το advantage μετατρέπεται σε περιορισμένο update. Καμία από αυτές τις επιλογές δεν επιβάλλει υποχρεωτικά έναν συγκεκριμένο transport operator.

Αυτός ο φακός προστατεύει και την αξιολόγηση. Όταν μια νέα συνταγή αλλάζει ταυτόχρονα reward, estimator, critic και clipping, ένα υψηλότερο score δεν λέει ποιο συστατικό βοήθησε. Το CompPO επιχειρεί να απομονώσει το transport και να το ελέγξει μαζί με έναν critic σχεδιασμένο για τα ίδια targets.

Γιατί GAE και GRPO είναι τυφλά στην αρχιτεκτονική

Το κλασικό Generalized Advantage Estimation χρησιμοποιεί σταθερούς συντελεστές συνέχειας. Η επιρροή ενός μεταγενέστερου residual μειώνεται γεωμετρικά κυρίως με βάση την απόσταση σε tokens. Πρόκειται για συνεπή και χρήσιμη μέθοδο, αλλά ο transport kernel είναι stationary: δεν γνωρίζει αν, στη συγκεκριμένη τροχιά, το μοντέλο βασίστηκε έντονα σε μια μακρινή πληροφορία.

Στις group-relative μεθόδους, ένα score που προκύπτει από τη σύγκριση πολλών απαντήσεων μεταδίδεται σε όλα τα έγκυρα tokens της ίδιας απάντησης. Αυτό αποφεύγει την ανάγκη για critic, αλλά δεν ξεχωρίζει ένα κρίσιμο token από ένα routine token όταν και τα δύο ανήκουν στην ίδια απόκριση.

Οι συγγραφείς ονομάζουν αυτή την απόσταση ανάμεσα στην πλούσια, content-dependent λειτουργία του Transformer και στον απλούστερο κανόνα credit architecture–credit mismatch. Δεν σημαίνει ότι GAE ή GRPO είναι λανθασμένα. Σημαίνει ότι ο estimator δεν χρησιμοποιεί μια μεταβλητή που ήδη παράγει η policy: τη δομή του πραγματοποιημένου υπολογισμού.

Σταθερό GAE

Μεταφέρει residuals με stationary γεωμετρικό kernel. Δύο μεταβάσεις με ίδια χρονική απόσταση λαμβάνουν την ίδια continuation geometry, ανεξάρτητα από το πώς υπολόγισε το Transformer.

Token distanceActor–critic

Group-relative credit

Συγκρίνει outcomes μέσα σε ομάδα απαντήσεων και μεταδίδει το response-level σήμα σε όλα τα tokens. Είναι critic-free, αλλά δεν έχει λεπτομερή δομή μέσα στην απάντηση.

Response broadcastΧωρίς critic

CompPO

Χρησιμοποιεί detached policy-internal statistic για path-dependent transport και ευθυγραμμίζει τον critic με τα ίδια computation-conditioned targets.

Realized pathAligned critic

Η διάκριση συνδέεται με ευρήματα για το πώς η RL και η SFT μεταβάλλουν τα εσωτερικά representations των reasoning models. Η απόδοση δεν κρίνεται μόνο από το τελικό κείμενο, αλλά και από το ποιο learning signal διαμορφώνει τις ενδιάμεσες αναπαραστάσεις.

CCT: όταν το credit ακολουθεί τον υπολογισμό

Το computation-conditioned credit transport, ή CCT, χρησιμοποιεί ένα στατιστικό από την παλαιά behavior policy για να παράγει ανά token μια bounded πύλη διατήρησης, την κt. Η πύλη επηρεάζει πόσο downstream value περνά από τη συγκεκριμένη μετάβαση. Η συνολική επίδραση ανάμεσα σε απομακρυσμένες θέσεις γίνεται το γινόμενο των ενδιάμεσων gates, άρα ο kernel είναι διαφορετικός για κάθε rollout.

Το gate αποθηκεύεται μαζί με το rollout και είναι detached. Δεν δημιουργεί έναν νέο ανεξέλεγκτο gradient δρόμο μέσα από το attention και δεν αλλάζει τη χρησιμότητα που ορίζει το περιβάλλον. Η μέθοδος κατασκευάζει έναν rollout-conditioned estimator για το συγκεκριμένο batch.

Αν το gate γίνει σταθερό και ίσο με τον συνηθισμένο discount factor, η μέθοδος επιστρέφει στο fixed-coefficient GAE. Το CCT είναι επομένως γενίκευση του transport και όχι απόρριψη του PPO. Η εξωτερική ανταμοιβή, το rollout format, το KL regularization και ο clipped policy objective παραμένουν στη θέση τους.

Η ιδέα είναι ευρύτερη από το attention. Μελλοντικός transport operator θα μπορούσε να χρησιμοποιεί retrieval provenance, memory access, MoE routing, observations από εργαλεία ή cross-modal ροές. Αυτές οι επεκτάσεις είναι ερευνητική κατεύθυνση, όχι αποτέλεσμα που έχει ήδη αποδειχθεί.

Πώς το attention γίνεται retention gate

Το CompPO είναι η πρώτη συγκεκριμένη υλοποίηση του CCT. Για κάθε έγκυρο response token συγκεντρώνει το final-layer grouped-query attention πάνω στο διαθέσιμο ιστορικό και υπολογίζει Herfindahl concentration. Ομοιόμορφο attention δίνει χαμηλή συγκέντρωση, ενώ η κυριαρχία λίγων προηγούμενων θέσεων δίνει υψηλή.

Επειδή το κατώτερο όριο της συγκέντρωσης αλλάζει με το μήκος του ιστορικού, το paper κανονικοποιεί το στατιστικό στο διάστημα 0–1. Στα κύρια πειράματα, το σήμα περνά από sigmoid με configured envelope 0,1–0,9 και temperature 4. Μεγαλύτερη συγκέντρωση σημαίνει ότι ο estimator διατηρεί περισσότερο downstream value στη μετάβαση.

Το ίδιο gate συμμετέχει τόσο στο one-step bootstrap όσο και στο path-dependent trace που ονομάζεται Comp-GAE. Δεν πολλαπλασιάζει απλώς το policy loss μετά το γεγονός. Επηρεάζει το TD target, τη συνέχεια όλων των μεταγενέστερων residuals και τη γεωμετρία της value εκτίμησης.

Η προσεκτική διατύπωση είναι κρίσιμη: η συγκέντρωση attention δεν αποκαλύπτει ποιο token προκάλεσε αιτιακά την ανταμοιβή. Περιγράφει τη μορφή της upstream υποστήριξης που χρησιμοποίησε η τρέχουσα απόφαση. Η συγγενική έρευνα για μάθηση από την αιτία μιας αποτυχίας δείχνει γιατί η διαφορά ανάμεσα σε χρήσιμο proxy και αιτιακή απόδειξη δεν πρέπει να χάνεται.

Ο transport-aligned critic χωρίς δεύτερο Transformer

Ένα δυναμικό target απαιτεί critic που μπορεί να το προβλέψει. Αν χρειαζόταν δεύτερο Transformer ίδιας κλίμακας, το κόστος θα γινόταν σοβαρό εμπόδιο. Ο transport-aligned critic, ή TAC, επαναχρησιμοποιεί hidden states και routing πληροφορία του actor και προσθέτει λιγότερο από 0,5% νέες trainable παραμέτρους.

Ο critic συνδυάζει representations από επιλεγμένα ανώτερα layers, φιλτράρει τις attention ακμές με learned relevance gates και δημιουργεί routed-history αναπαράσταση. Δύο ελαφριά heads παράγουν local value και history-aware value. Το retention gate που σχημάτισε το target καθορίζει και το μείγμα αυτών των εκτιμήσεων.

Πρόκειται για co-design υπόθεση, όχι για γενικό θεώρημα ότι κάθε standard critic αποτυγχάνει. Για αυτό η αξιολόγηση χρησιμοποιεί factorial design: δυναμικό ή mean-matched σταθερό transport, σε συνδυασμό με standard ή aligned critic. Έτσι ελέγχεται αν η διαφορά προέρχεται μόνο από το gate, μόνο από τη χωρητικότητα του critic ή από τη συνεργασία τους.

Η state-dependent καθοδήγηση έχει αξία μόνο όταν το σήμα ταιριάζει στην πραγματική κατάσταση. Αυτό είναι το ίδιο πρακτικό μάθημα που αναδεικνύει η καθοδήγηση AI agent ανά κατάσταση: ένα πρόσθετο learning signal πρέπει να ενεργοποιείται εκεί όπου είναι σχετικό, όχι ομοιόμορφα παντού.

Τι έδειξε η σύγκριση CompPO και GRPO

Η κύρια αξιολόγηση χρησιμοποιεί Qwen3-4B, κοινό 3×3 grid επιλογής actor learning rate και KL και πέντε ανεξάρτητα seeds. Το CompPO έφτασε τελική held-out development accuracy 61,4%, με 95% διάστημα εμπιστοσύνης 60,8–62,0. Το ξεχωριστά ρυθμισμένο GRPO έφτασε 53,8%, με διάστημα 52,9–54,7.

Στο καλύτερο checkpoint οι τιμές ήταν 61,7% για CompPO και 56,2% για GRPO. Η πτώση από το peak έως το τέλος ήταν 0,3 ποσοστιαίες μονάδες για CompPO και 2,4 για GRPO. Επιπλέον, κάθε seed του CompPO ξεπέρασε κάθε seed του GRPO τόσο στο καλύτερο όσο και στο τελικό endpoint.

Στο 2×2 factorial πείραμα, το Comp-GAE με standard critic έφτασε 55,2%, ενώ ο aligned critic με mean-matched σταθερό gate έφτασε 56,4%. Το πλήρες CompPO έφτασε 61,4% και εμφάνισε seed-matched interaction +2,4 μονάδων, με διάστημα 1,9–2,9. Το αποτέλεσμα υποστηρίζει ότι transport και critic είναι συμπληρωματικά.

Αποτελέσματα του preprint

Τέσσερις αριθμοί που ορίζουν το εύρημα

Οι τιμές αφορούν το συγκεκριμένο training setup, τα πέντε Qwen3-4B seeds και το matched PPO stress grid.

61,4%τελική held-out accuracy του CompPO
53,8%τελική held-out accuracy του ρυθμισμένου GRPO
+2,4μονάδες seed-matched gate–critic interaction
10/12stable CompPO runs στο matched stress grid

Πηγή: arXiv 2608.21501 v1, ενότητες 7.1–7.5.

Η frozen αξιολόγηση από τα τελικά checkpoints έδωσε βελτίωση 4,3 greedy pass@1 macro μονάδων στο Qwen3-4B και 3,9 στο Llama-3.1-8B-Instruct έναντι GRPO. Πρόκειται για point estimates χωρίς training-seed confidence intervals, οπότε λειτουργούν ως ένδειξη μεταφοράς και όχι ως ισοδύναμη στατιστική επιβεβαίωση.

Το αποτέλεσμα πρέπει επίσης να διαβάζεται μαζί με το benchmark design. Όπως δείχνει η ανάλυση για το πώς το harness μπορεί να αλλάξει τον φαινομενικό νικητή, το dataset, το endpoint, το aggregation και η επιλογή checkpoint είναι μέρος του ισχυρισμού και όχι τεχνικές λεπτομέρειες.

Shuffle controls, position controls και σταθερότητα

Ένα υψηλότερο gate θα μπορούσε να βελτιώνει το αποτέλεσμα χωρίς να μεταφέρει trajectory-specific πληροφορία. Για να ελεγχθεί αυτή η εξήγηση, οι συγγραφείς ανακάτεψαν τα gates ανάμεσα στις έγκυρες θέσεις, διατηρώντας τη συνολική κατανομή αλλά καταστρέφοντας τη σύνδεση με το αντίστοιχο token.

Δοκιμάστηκε επίσης frozen position-only πρόγραμμα από 20 bins κανονικοποιημένου μήκους. Και οι δύο έλεγχοι μείωσαν την επίδοση. Δεν αποδεικνύουν causal token attribution, αλλά δείχνουν ότι η ωφέλεια δεν εξηγείται μόνο από ένα ευνοϊκό μέσο gate ή από τη θέση μέσα στην απάντηση.

Στο matched stress grid με PPO, stable θεωρήθηκε ένα run που τελείωνε τουλάχιστον στη base accuracy 42,4%, είχε peak-to-final πτώση κάτω από 15 μονάδες και δεν εμφάνιζε πέντε συνεχόμενα post-peak checkpoints κάτω από τη βάση. Το CompPO ήταν stable σε 10 από 12 runs και το PPO σε 3 από 12.

Το συμπέρασμα είναι περιορισμένο αλλά χρήσιμο: το CompPO είχε ευρύτερη stable περιοχή στο συγκεκριμένο grid. Δεν αποδεικνύεται ότι το PPO δεν μπορεί να σταθεροποιηθεί με δική του εξειδικευμένη ρύθμιση. Μάλιστα, ένα CompPO cell με υψηλό learning rate και μηδενικό KL ήταν επίσης ασταθές.

Τι σημαίνει για ομάδες που χτίζουν AI προϊόντα

Για μια ομάδα e-commerce, marketing ή customer experience, το paper δεν προσφέρει έτοιμο plug-in που αυξάνει conversions. Προσφέρει έναν σχεδιαστικό φακό για σύνθετα AI workflows: η τελική ανταμοιβή δεν αρκεί· χρειάζεται να εξετάζεται και ο μηχανισμός που αποδίδει credit στα ενδιάμεσα βήματα.

Ένας agent μπορεί να ανακτά προϊόντα, να ελέγχει απόθεμα, να εφαρμόζει business rules και να συνθέτει απάντηση. Το CompPO δεν δοκιμάστηκε σε tool use ή retrieval και επομένως δεν αποδεικνύει βελτίωση σε αυτό το σενάριο. Δείχνει όμως γιατί provenance, tool-observation edges ή memory access μπορούν να εξεταστούν ως μελλοντικές μεταβλητές transport αντί να θεωρούνται όλα τα βήματα ισοδύναμα.

Η σύνδεση με το credit assignment στα βήματα αναζήτησης ενός AI agent είναι άμεση αλλά όχι ταυτόσημη. Το LOTAPO χρησιμοποιεί counterfactual αφαίρεση ολόκληρων search turns, ενώ το CompPO χρησιμοποιεί policy-internal computation για token-level transport. Και οι δύο προσεγγίσεις απορρίπτουν την ιδέα ότι μια τελική σωστή απάντηση αρκεί για να αξιολογηθούν όλα τα ενδιάμεσα βήματα.

Για τεχνικούς υπευθύνους, η πρακτική προτεραιότητα είναι η παρατηρησιμότητα. Αν η υποδομή δεν κρατά rollout-level traces, policy version, verifier output και τα internal signals που χρησιμοποιούνται για credit, δεν μπορεί να ελέγξει αν ένας trajectory-dependent estimator είναι πράγματι καλύτερος ή απλώς πιο περίπλοκος.

Απόφαση πριν από pilot

Μην υιοθετείτε architecture-aware credit χωρίς μηχανισμό διάψευσης

Απαιτήστε σταθερό baseline, κοινό tuning budget, shuffle και position controls, critic diagnostics, frozen evaluation, πλήρες systems profiling και rollback criterion. Αν η βελτίωση επιβιώνει μόνο σε ένα seed ή ένα development endpoint, δεν είναι production evidence.

Τι χρειάζεται πριν από production χρήση

Η πρώτη απαίτηση είναι ένα σαφές learning contract: ποιο reward θεωρείται επιτυχία, σε ποιο επίπεδο γίνεται το credit assignment, ποια internal signals αποθηκεύονται και ποια έκδοση policy παρήγαγε κάθε rollout. Το reward, ο estimator και το update geometry πρέπει να μπορούν να ελεγχθούν ξεχωριστά.

Η δεύτερη απαίτηση είναι traceability. Κάθε experiment χρειάζεται dataset version, prompt set, verifier version, policy checkpoint, gate statistics, critic diagnostics, hyperparameters και frozen test results. Η ίδια λογική βρίσκεται πίσω από το αποδεικτικό μιας απόφασης AI runtime: χωρίς provenance, μια ομάδα βλέπει το outcome αλλά δεν μπορεί να αναπαράγει τη διαδρομή που το παρήγαγε.

Η τρίτη απαίτηση είναι systems profiling. Οι συγγραφείς δεν διατήρησαν ακριβή στοιχεία για GPU model και count, wall-clock time, peak HBM, generated-token count ή throughput. Το ότι ο TAC προσθέτει λιγότερο από 0,5% trainable παραμέτρους είναι αρχιτεκτονικό στοιχείο, όχι τεκμηριωμένη εξοικονόμηση κόστους.

Η τέταρτη απαίτηση είναι παρακολούθηση co-adaptation. Ένα μοντέλο θα μπορούσε με τον χρόνο να μάθει routing patterns που χειραγωγούν τον estimator χωρίς να βελτιώνουν την εργασία. Detached gates και τα σημερινά controls δεν αποκλείουν αυτό το reward-hacking μονοπάτι σε μακροχρόνια εκπαίδευση.

Τέλος, τα training environments πρέπει να λειτουργούν με συνέπεια. Η αξία ενός estimator δεν μπορεί να διαχωριστεί από την αξιοπιστία των tasks και των verifiers, όπως φαίνεται και στην ανάγκη οι κόσμοι εκπαίδευσης των AI agents να λειτουργούν πραγματικά.

Επτά βήματα για ελεγχόμενο pilot

Ένα ασφαλές pilot δεν ξεκινά με αντικατάσταση του optimizer σε ολόκληρη την παραγωγή. Ξεκινά offline, με συγκεκριμένο task, γνωστά failure modes και κοινό budget για τις baselines. Στόχος είναι να απομονωθεί αν το computation-conditioned transport προσθέτει πληροφορία και αν το πρόσθετο operational κόστος δικαιολογείται.

Από το reward signal σε ελέγξιμο architecture-aware training

  1. Стъпка 1Ορίστε το reward evidence

    Καταγράψτε ποιο outcome θεωρείται σωστό, ποιος verifier το μετρά και πού υπάρχουν sparse, delayed ή αμφίσημα rewards. Μην αλλάξετε reward και transport στο ίδιο πρώτο πείραμα.

  2. Стъпка 2Χαρτογραφήστε τη διαδρομή του credit

    Περιγράψτε αν το baseline χρησιμοποιεί fixed GAE, response-level broadcast ή άλλο estimator και ποια υπόθεση κάνει για την εξάρτηση ανάμεσα στα βήματα.

  3. Стъпка 3Καταγράψτε policy-internal signals

    Αποθηκεύστε attention concentration ή άλλο signal μαζί με policy version, masks και rollout metadata. Κρατήστε το detached ώστε το pilot να μετρά estimator transport και όχι νέο gradient path.

  4. Стъпка 4Ευθυγραμμίστε τον critic με τα targets

    Συγκρίνετε standard και computation-aware critic με ίδιο training budget. Παρακολουθήστε explained variance και συσχέτιση με TD targets, όχι μόνο την τελική accuracy.

  5. Стъпка 5Τρέξτε negative controls

    Χρησιμοποιήστε mean-matched σταθερό gate, global shuffle και position-only schedule. Αν η επίδοση παραμένει ίδια, το trajectory-specific signal πιθανότατα δεν προσφέρει την υποσχόμενη πληροφορία.

  6. Стъпка 6Μετρήστε γενίκευση και πραγματικό κόστος

    Κρατήστε frozen benchmarks εκτός tuning, επαναλάβετε σε πολλαπλά seeds και καταγράψτε GPU ώρες, wall-clock, HBM, throughput και generated tokens.

  7. Стъпка 7Ορίστε release gate και rollback

    Προχωρήστε μόνο αν η βελτίωση επιβιώνει στα controls, δεν επιδεινώνει κρίσιμα failure modes και έχει αποδεκτό κόστος. Διατηρήστε σταθερό estimator ως ασφαλή διαδρομή επαναφοράς.

Όρια και πρακτικό συμπέρασμα

Η μελέτη είναι preprint και το πεδίο της είναι συγκεκριμένο. Τα πειράματα καλύπτουν μαθηματικό reasoning, δύο Transformer backbones έως 8B παραμέτρους, terminal verifiers και responses έως 16K tokens. Δεν υπάρχουν αποδείξεις για διάλογο, code generation, tool use, retrieval, multimodal trajectories, dense rewards ή μεγαλύτερα μοντέλα.

Το attention concentration είναι proxy και μπορεί να επηρεαστεί από attention sinks, positional bias, induction heads και calibration. Τα learned relevance gates και τα negative controls μειώνουν εναλλακτικές εξηγήσεις, αλλά δεν τις εξαφανίζουν. Επίσης, η policy αλλάζει ενώ τα gates προέρχονται από την behavior policy, οπότε η staleness παραμένει πραγματικός περιορισμός.

Η ισχυρότερη ένδειξη δεν είναι μόνο η διαφορά 61,4% έναντι 53,8%. Είναι ότι το full model ξεπέρασε και τις δύο μεμονωμένες παραλλαγές, τα shuffled και position-only controls υποβάθμισαν την επίδοση και η εικόνα μεταφέρθηκε περιγραφικά σε δεύτερο backbone. Παρ’ όλα αυτά, το ισχυρότερο 8×8 GRPO control και τα frozen benchmark αποτελέσματα παραμένουν point estimates.

Το ώριμο συμπέρασμα για μια επιχείρηση δεν είναι «αντικαταστήστε το GRPO με CompPO». Είναι ότι η εκπαίδευση ενός learning system πρέπει να ξεχωρίζει την ποιότητα του reward, τη μεταφορά του credit και τη γεωμετρία του update. Όταν μια βελτίωση χρησιμοποιεί εσωτερικά signals, χρειάζεται να αποδείξει με controls ότι το πραγματικό trajectory προσθέτει πληροφορία και με systems measurements ότι η βελτίωση αξίζει το κόστος.

AI workflows με ελεγχόμενη διαδρομή

Μετατρέψτε ένα AI pilot σε μετρήσιμο και αναστρέψιμο σύστημα

Η TWO DOTS σχεδιάζει επιχειρησιακούς αυτοματισμούς με σαφή reward criteria, traces, benchmarks, ανθρώπινα checkpoints, monitoring και fallback, ώστε να αξιολογείται τόσο το αποτέλεσμα όσο και η διαδρομή που το παρήγαγε.

Често задавани въпроси

Τι είναι το credit assignment στα LLM;

Είναι η διαδικασία που μετατρέπει μια τελική ανταμοιβή ή άλλο evidence σε σήμα μάθησης για τις επιμέρους αποφάσεις και τα tokens μιας ακολουθίας.

Τι αλλάζει το CompPO σε σχέση με το PPO;

Διατηρεί την εξωτερική ανταμοιβή και τον clipped PPO στόχο, αλλά αλλάζει το bootstrap, το advantage trace και τον critic ώστε το credit transport να εξαρτάται από εσωτερική πληροφορία της policy.

Χρησιμοποιεί το attention ως απόδειξη αιτιότητας;

Όχι. Η εργασία αντιμετωπίζει τη συγκέντρωση attention ως structural proxy για routing sharpness και όχι ως απόδειξη ότι ένα συγκεκριμένο token προκάλεσε την ανταμοιβή.

Γιατί χρειάζεται transport-aligned critic;

Επειδή τα δυναμικά targets του Comp-GAE χρειάζονται value estimator που βλέπει συμβατή routing πληροφορία. Στο factorial πείραμα, ούτε το δυναμικό gate ούτε ο aligned critic μόνος του έφτασε την πλήρη επίδοση.

Ήταν καλύτερο το CompPO από το GRPO;

Στα πέντε Qwen3-4B seeds της συγκεκριμένης μελέτης, το CompPO έφτασε 61,4% τελική held-out development accuracy έναντι 53,8% του ρυθμισμένου GRPO. Αυτό δεν αποδεικνύει καθολική υπεροχή σε άλλα tasks ή μοντέλα.

Είναι το CompPO γρηγορότερο ή οικονομικότερο;

Δεν τεκμηριώνεται τέτοιος ισχυρισμός. Ο critic προσθέτει λιγότερο από 0,5% νέες trainable παραμέτρους, αλλά δεν δημοσιεύονται επαρκή GPU, wall-clock, throughput ή peak-memory στοιχεία.

Έχει δοκιμαστεί σε e-commerce agents ή tool use;

Όχι. Τα πειράματα αφορούν μαθηματικό reasoning. Η εφαρμογή σε retrieval, εργαλεία, διάλογο, κώδικα ή εμπορικά workflows παραμένει υπόθεση που χρειάζεται ξεχωριστό benchmark.

Ποιο είναι το ασφαλές επόμενο βήμα για μια ομάδα AI;

Να ξεκινήσει με offline pilot που κρατά reward evidence, rollout traces, policy version και internal signals, και να συγκρίνει σταθερό transport με architecture-aware transport μέσω negative controls και rollback criteria.

Информационен бюлетин

Въведете имейл адреса си по-долу, за да се абонирате за нашия бюлетин