SMRC-SD: γιατί η σωστή καθοδήγηση ενός AI agent εξαρτάται από την κατάστασή του

Το SMRC-SD ελέγχει αν μια επιτυχημένη διαδρομή ταιριάζει με την πραγματική κατάσταση ενός AI agent πριν τη χρησιμοποιήσει ως καθοδήγηση. Δείτε τι έδειξαν ALFWorld, WebShop και τα ablation tests.

Το SMRC-SD δείχνει ότι μια επιτυχημένη διαδρομή είναι χρήσιμη για έναν AI agent μόνο όταν περιέχει συνέχεια συμβατή με την κατάσταση στην οποία βρίσκεται τώρα.

Στα πειράματα με Qwen3-1.7B, η επιτυχία ανέβηκε από 0,746 σε 0,865 στο ALFWorld και από 0,574 σε 0,693 στο WebShop. Το κρίσιμο εύρημα δεν είναι «περισσότερη καθοδήγηση», αλλά σωστό routing: όταν δεν υπάρχει state match, το σύστημα συνεχίζει να μαθαίνει χωρίς να επιβάλλει μια τοπικά αβάσιμη υπόδειξη.

Contents

Ένας AI agent μπορεί να έχει μπροστά του μια αποδεδειγμένα επιτυχημένη λύση και παρ’ όλα αυτά να καθοδηγείται προς τη λάθος κατεύθυνση. Το παράδοξο εμφανίζεται όταν έχει ήδη κάνει διαφορετικές ενέργειες από τη διαδρομή αναφοράς: βρίσκεται σε άλλη σελίδα, κρατά άλλο αντικείμενο, έχει ολοκληρώσει διαφορετικό υποστόχο ή έχει αλλάξει την κατάσταση του περιβάλλοντος. Η λύση παραμένει σωστή για το σημείο από το οποίο ξεκίνησε, όχι όμως απαραίτητα για το σημείο όπου βρίσκεται τώρα ο agent.

Αυτό είναι το state–reference mismatch που περιγράφουν οι Junzhuo Liu, Weiwei Li, Jun Ling και Peng Wang. Στην εργασία τους παρουσιάζουν το State-Matched Routing and Contextualized Self-Distillation (SMRC-SD): μια μέθοδο που δεν ρωτά μόνο αν υπάρχει επιτυχημένο παράδειγμα, αλλά αν το παράδειγμα διαθέτει συμβατή συνέχεια για την τρέχουσα κατάσταση. Για ομάδες που χτίζουν agentic εμπειρίες σε e-commerce, εξυπηρέτηση, εσωτερικά εργαλεία ή business automation with AI, η αρχή είναι σαφής: η καθοδήγηση πρέπει να αντιστοιχεί στο πραγματικό σημείο της διαδικασίας.

Το κενό ανάμεσα σε μια σωστή λύση και ένα σωστό επόμενο βήμα

Η εκπαίδευση multi-turn agents είναι δύσκολη επειδή η αξία μιας απόφασης εξαρτάται από όσα έχουν προηγηθεί. Μια τελική ανταμοιβή μπορεί να πει ότι η συνολική προσπάθεια πέτυχε ή απέτυχε, αλλά δεν εξηγεί ποια ενδιάμεση απόφαση βοήθησε και ποια πρέπει να αλλάξει. Η on-policy distillation προσφέρει πυκνότερη εποπτεία: ο student agent εξερευνά και ένας συγχρονισμένος teacher επαναβαθμολογεί τις απαντήσεις του με πρόσβαση σε πρόσθετο υλικό εκπαίδευσης.

Όταν αυτό το υλικό είναι μια επιτυχημένη διαδρομή, η απλή επιλογή είναι να δίνεται ολόκληρη στον teacher σε κάθε γύρο. Οι ερευνητές ονομάζουν αυτή τη βάση FullPath-SD. Όμως κάθε ενέργεια της διαδρομής είναι έγκυρη για την κατάσταση που προηγήθηκε. Αν ο student έχει αποκλίνει, η επόμενη κίνηση της αναφοράς μπορεί να μην είναι διαθέσιμη ή να μην έχει πλέον νόημα.

Στο WebShop, για παράδειγμα, μια διαδρομή μπορεί να αφορά το Product A, ενώ ο agent βρίσκεται στη σελίδα του Product B. Η ενέργεια «επιστροφή στην αναζήτηση» μπορεί να είναι η σωστή ανάκαμψη για τον student, παρότι δεν ταιριάζει με την επόμενη κίνηση της αναφοράς. Αυτό είναι συγγενικό με την πρακτική ανάγκη να αποδίδεται σωστά η ευθύνη όταν ένας AI agent αποτυγχάνει: το λάθος μπορεί να βρίσκεται στη συνθήκη καθοδήγησης και όχι στην πειθαρχία εκτέλεσης.

Αποχή δεν σημαίνει διακοπή. Στο SMRC-SD, ένας unmatched γύρος δεν αφαιρείται από το rollout και δεν μένει χωρίς learning signal. Συνεχίζει με τον βασικό στόχο GRPO· απλώς δεν προστίθεται reference-conditioned distillation όταν το reference δεν στηρίζει τοπικά την κατάσταση.

Πώς λειτουργεί το SMRC-SD

Το SMRC-SD χειρίζεται την επιτυχημένη διαδρομή ως πόρο ευρετηριασμένο ανά κατάσταση. Σε κάθε γύρο ανακατασκευάζει μια συμπαγή υπογραφή της τρέχουσας κατάστασης και τη συγκρίνει με τις καταστάσεις πριν από κάθε ενέργεια της αναφοράς. Ο έλεγχος δεν περιορίζεται σε ομοιότητα κειμένου. Περιλαμβάνει όσα αλλάζουν την εκτελεσιμότητα ή το νόημα της επόμενης κίνησης, μαζί με το αν η υποψήφια ενέργεια ανήκει στις τρέχουσες επιτρεπτές ενέργειες.

Αν βρεθεί συμβατή θέση, το σύστημα ενεργοποιεί self-distillation και επιλέγει την τελευταία συμβατή θέση, ώστε να μην επαναλαμβάνει υποστόχους που έχουν ήδη ολοκληρωθεί. Αν δεν βρεθεί, ο γύρος συνεχίζει με GRPO χωρίς προνομιακή υπόδειξη. Για έναν matched γύρο, ο teacher λαμβάνει την πλήρη επιτυχημένη διαδρομή για τη συνολική δομή, μια σύντομη περίληψη της πραγματικής κατάστασης του student και τη grounded υποψήφια συνέχεια.

Ο διαχωρισμός είναι ουσιαστικός: το γενικό σχέδιο απαντά «πού θέλουμε να φτάσουμε», ενώ το state match απαντά «ποιο βήμα είναι εφαρμόσιμο τώρα». Παρόμοια, ένα σύστημα με μνήμη χρειάζεται μηχανισμό ανάκλησης που σέβεται την τρέχουσα κατάσταση, αλλιώς δημιουργεί το είδος semantic rollback όπου ο agent θυμάται σωστά, αλλά σε λάθος σημείο.

Γιατί το routing προηγείται της ποσότητας της εποπτείας

Τα ablation tests δείχνουν ότι το βασικό κέρδος δεν προέρχεται απλώς από λιγότερη distillation. Στο ALFWorld με Qwen3-1.7B, η FullPath-SD πέτυχε Average@4 0,746. Όταν το ίδιο πλήρες context εφαρμόστηκε μόνο σε matched γύρους, το αποτέλεσμα ανέβηκε σε 0,836. Με το πλήρες SMRC context — διαδρομή, κατάσταση και υποψήφια ενέργεια — έφτασε 0,865.

Οι matched γύροι ήταν κατά μέσο όρο το 15,3% των γύρων, ενώ ένα random control επέλεξε σχεδόν το ίδιο πλήθος, 16,5%. Παρ’ όλα αυτά, το τυχαίο routing έδωσε 0,723 και το state-matched routing 0,836. Άρα η βελτίωση δεν εξηγείται από την αραιότητα, αλλά από την ταυτότητα των γύρων στους οποίους εφαρμόζεται η καθοδήγηση.

Οι μετρήσεις που απομονώνουν την αξία του state match

Όλες οι τιμές προέρχονται από την εργασία SMRC-SD με Qwen3-1.7B και τα δηλωμένα ALFWorld/WebShop πρωτόκολλα. Δεν αποτελούν πρόβλεψη απόδοσης για εμπορικό deployment.

0,746 → 0,865
ALFWorld Average@4

Η state-matched routing και contextualized guidance υπερέβησαν την unconditional FullPath-SD.

0,574 → 0,693
WebShop accuracy

Η binary επιτυχία αυξήθηκε στο ίδιο Qwen3-1.7B comparison.

15,3%
Matched γύροι

Μόνο αυτό το μέσο ποσοστό γύρων έλαβε FullPath-SD στο state-matched routing control.

+0,113
Matched έναντι random

Με παρόμοιο πλήθος επιλεγμένων γύρων, το 0,836 ξεπέρασε το 0,723 του random control.

Η μονάδα +0,113 είναι απόλυτη διαφορά Average@4, όχι ποσοστιαία μεταβολή.

Τι συμβαίνει όταν αλλάζει χωριστά το routing και το context

FullPath-SD

Δίνει το πλήρες reference σε matched και unmatched γύρους. ALFWorld Average@4: 0,746.

Όλοι οι γύροιPlain path

Routing μόνο

Κρατά το plain path, αλλά ενεργοποιεί distillation μόνο σε matched γύρους. Average@4: 0,836.

Matched onlyΚύριο κέρδος

Dynamic context χωρίς routing

Χρησιμοποιεί SMRC context στους matched γύρους, αλλά FullPath-SD στους unmatched. Average@4: 0,695.

Λάθος routeΧειρότερο αποτέλεσμα

Πλήρες SMRC-SD

Συνδυάζει matched-only routing με path, state summary και grounded candidate. Average@4: 0,865.

Route + contextΚαλύτερο

Τι έδειξαν τα ALFWorld και WebShop

Η αξιολόγηση έγινε σε δύο διαδραστικά περιβάλλοντα. Το ALFWorld περιλαμβάνει οικιακές εργασίες σε text-based περιβάλλον, όπου αλλάζουν θέση, inventory, ιδιότητες αντικειμένων και πρόοδος υποστόχων. Το WebShop αφορά αναζήτηση και αγορά προϊόντων, όπου οι σελίδες, οι επιλογές και η πρόοδος αλλάζουν συνεχώς. Χρησιμοποιήθηκαν τα επίσημα test splits, 128 tasks και τέσσερα rollouts από την αρχική κατάσταση.

Με Qwen3-1.7B, το SMRC-SD βελτίωσε το ALFWorld Average@4 από 0,746 της FullPath-SD σε 0,865 και το WebShop accuracy από 0,574 σε 0,693. Το graded WebShop score ανέβηκε από 0,694 σε 0,825. Με Qwen2.5-3B-Instruct, το Average@4 στο ALFWorld ήταν 0,883 έναντι 0,766, ενώ το WebShop score ήταν 0,863 έναντι 0,842.

Οι αριθμοί αφορούν τα συγκεκριμένα benchmarks, μοντέλα και πρωτόκολλα. Δεν αποδεικνύουν αυτόματα αντίστοιχη βελτίωση σε εμπορικό deployment. Δείχνουν όμως με συνέπεια ότι μια επιτυχημένη τροχιά είναι πιο χρήσιμη όταν ελέγχεται η συμβατότητα με το state. Για web-based agents, αυτό συμπληρώνει την παρατήρηση ότι ακόμη και ένας agent που έχει βρει τη σωστή πληροφορία μπορεί να αποτύχει στην αξιοποίηση της, όπως δείχνει η ανάλυση του SearchAuditor για AI search agents.

Μικρότερες και λιγότερο επαναληπτικές απαντήσεις

Η έρευνα δεν μέτρησε μόνο επιτυχία. Στο τελικό checkpoint του Qwen3 στο ALFWorld, το SMRC-SD είχε μέση πλήρη απάντηση 78,8 tokens, κοντά στα 79,5 του GRPO. Η FullPath-SD έφτασε τα 142,6 και η Skill-SD τα 255,6. Ο ρυθμός επαναλαμβανόμενων 4-grams ήταν 8,8% για SMRC-SD, 20,7% για FullPath-SD και 38,6% για Skill-SD.

Αυτά είναι διαγνωστικά μορφής output, όχι μέτρα ποιότητας reasoning. Ωστόσο έχουν επιχειρησιακό ενδιαφέρον: ένας agent που επιτυγχάνει με λιγότερη φλυαρία καταναλώνει μικρότερο output budget και δημιουργεί καθαρότερη εμπειρία. Η μελέτη δείχνει ότι το state-aware supervision δεν χρειάζεται μακρύτερο response για να είναι αποτελεσματικό.

Πώς κατασκευάζονται τα state signatures

Οι authors χρησιμοποιούν environment-specific adapters. Για την αναφορά, η υπογραφή ανακατασκευάζεται από τα task metadata και το prefix των προηγούμενων ενεργειών. Για τον student, προκύπτει από το πραγματικό history, την παρατήρηση και τις διαθέσιμες ενέργειες. Οι υπογραφές είναι συμπαγείς, ντετερμινιστικές και χειροποίητες, όχι learned semantic embeddings.

Η σχέση matching είναι κατευθυντική. Επιτρέπει πρόσθετη πρόοδο μόνο όταν αυτή δεν αλλάζει τη σημασία της συνέχειας. Όσα πεδία επηρεάζουν την εκτελεσιμότητα ελέγχονται αυστηρά. Στο WebShop, η ενεργή σελίδα και οι επιλογές προϊόντος μπορεί να είναι κρίσιμες· στο ALFWorld κρίσιμα μπορεί να είναι το inventory ή η κατάσταση ενός αντικειμένου.

Αυτό περιορίζει τη γενικότητα της υλοποίησης. Η ιδέα μεταφέρεται, αλλά ο adapter πρέπει να γνωρίζει ποια πεδία αποτελούν ουσιαστική κατάσταση για το συγκεκριμένο workflow. Σε μια επιχείρηση, το state model δεν πρέπει να είναι απλώς όλο το conversation log. Πρέπει να περιγράφει όσα επηρεάζουν πραγματικά την επόμενη επιτρεπτή ενέργεια.

Πότε επιτρέπεται να ενεργοποιηθεί ένα reference;

Μόνο όταν το task identity, η πρόοδος εκτέλεσης και η διαθεσιμότητα της επόμενης ενέργειας είναι συμβατά με το live state.

Αν λείπει ένα από αυτά, η ασφαλής επιλογή είναι βασική policy, νέο retrieval, εργαλείο επαλήθευσης ή ανθρώπινη κλιμάκωση — όχι η «πλησιέστερη» επιτυχημένη διαδρομή.

Η πρακτική μετάφραση για e-commerce και customer experience

Σε έναν εμπορικό agent, οι επιτυχημένες συνομιλίες ή workflows μπορούν να λειτουργούν ως references μόνο αν διαχωρίζονται από το live state. Ένα checkout playbook δεν πρέπει να καθοδηγεί τον agent σαν ο χρήστης να βρίσκεται ακόμη στο cart όταν έχει ήδη ολοκληρώσει την πληρωμή. Μια διαδικασία επιστροφής δεν πρέπει να προτείνει label πριν επιβεβαιωθεί η επιλεξιμότητα. Ένα sales assistant δεν πρέπει να συνεχίζει τη διαδρομή για ένα προϊόν όταν ο επισκέπτης έχει αλλάξει κατηγορία ή constraint.

Η μελέτη δεν δοκιμάζει αυτά τα εταιρικά σενάρια, επομένως πρόκειται για εφαρμοσμένη ερμηνεία της μεθόδου. Η ασφαλής αρχιτεκτονική αρχίζει με ρητό state: τρέχον βήμα, ολοκληρωμένοι υποστόχοι, ενεργά αντικείμενα, διαθέσιμες ενέργειες και μη αναστρέψιμες πράξεις. Στη συνέχεια, κάθε reference πρέπει να επιστρέφει όχι μόνο ένα πιθανό επόμενο βήμα, αλλά και τις προϋποθέσεις υπό τις οποίες αυτό είναι έγκυρο.

Για e-shops που προετοιμάζονται για αγορές από AI agents, το state περιλαμβάνει προϊόν, variant, διαθεσιμότητα, cart, πληρωμή, δικαιώματα και τρέχουσα σελίδα. Το σημαντικό pattern είναι το abstention: όταν δεν υπάρχει συμβατό reference state, ο agent χρειάζεται άλλο μηχανισμό αντί να πιέζεται να ακολουθήσει την πλησιέστερη γνωστή διαδρομή.

Κόστος εκπαίδευσης και περιορισμοί

Τα στοιχεία matching χρησιμοποιούνται μόνο κατά την εκπαίδευση. Στο inference αφαιρούνται references, signatures, matcher, candidates και teacher context, οπότε η μέθοδος δεν προσθέτει prompt tokens ή νέο inference component. Στο ALFWorld, το SMRC context πρόσθεσε κατά μέσο όρο 20,96 tokens σε σχέση με FullPath-SD: 133,8 έναντι 112,9. Το Skill-SD context ήταν 943,5 tokens κατά μέσο όρο.

Το CPU pipeline για reference lookup, signature, matching, grounding, rendering και bookkeeping χρειάστηκε κατά μέσο όρο 0,833 milliseconds ανά matched turn στη συγκεκριμένη υποδομή και υλοποίηση. Αυτό δεν αποτελεί εγγύηση κόστους για άλλο σύστημα, αλλά δείχνει ότι ο ντετερμινιστικός matcher μπορεί να είναι ελαφρύς σε σχέση με το model scoring.

Οι περιορισμοί δεν πρέπει να κρυφτούν. Οι state adapters είναι χειροποίητοι και εξαρτώνται από το περιβάλλον. Αρκετές καμπύλες είναι single runs και τα fixed checkpoints δεν επιλέχθηκαν μέσω validation. Matched και unmatched είναι λειτουργικές ετικέτες του matcher, όχι βέβαιες ετικέτες ορθότητας κάθε action. Σε πραγματικές ροές, η task identity και η ποιότητα των references παραμένουν ξεχωριστά προβλήματα governance. Γι’ αυτό το SMRC-SD πρέπει να διαβάζεται μαζί με τον ευρύτερο κίνδυνο της self-distillation που ενισχύει λάθος bias.

Πέντε έλεγχοι πριν από την παραγωγή

Η εργασία δεν είναι έτοιμη συνταγή για customer-facing deployment. Προσφέρει όμως έναν χρήσιμο τρόπο να σχεδιαστεί και να ελεγχθεί η σχέση ανάμεσα σε live state, references και επιτρεπτές ενέργειες.

Πέντε έλεγχοι για state-compatible guidance σε επιχειρηματικό workflow

  1. Step 1Ορίστε το state που αλλάζει την απόφαση

    Καταγράψτε τρέχον στάδιο, ενεργό αντικείμενο, ολοκληρωμένους υποστόχους, δικαιώματα και μη αναστρέψιμες ενέργειες· όχι ολόκληρο το conversation log χωρίς διάκριση.

  2. Step 2Δώστε preconditions σε κάθε reference

    Μια επιτυχημένη διαδρομή πρέπει να δηλώνει από ποια κατάσταση ισχύει η συνέχειά της και ποια επόμενη ενέργεια πρέπει να παραμένει διαθέσιμη.

  3. Step 3Μετρήστε matched και unmatched αποφάσεις χωριστά

    Το συνολικό success rate μπορεί να κρύψει επιβλαβή guidance σε states που δεν υποστηρίζονται από το reference.

  4. Step 4Χρησιμοποιήστε same-count random control

    Συγκρίνετε state-based routing με τυχαία επιλογή ίδιου πλήθους γύρων, ώστε να ξεχωρίσετε την ποιότητα επιλογής από την απλή αραιότητα.

  5. Step 5Ελέγξτε continuation και fallback

    Επιβεβαιώστε ότι η κίνηση είναι διαθέσιμη, επιτρεπτή και συμβατή με τον στόχο. Αν όχι, δρομολογήστε verifier, νέο search ή ανθρώπινη παρέμβαση.

Το ουσιαστικό μάθημα για agentic AI

Το SMRC-SD δεν υποστηρίζει ότι οι επιτυχημένες διαδρομές είναι άχρηστες. Δείχνει ότι η αξία τους είναι τοπική και υπό όρους. Η σωστή ερώτηση δεν είναι «έχουμε ένα παράδειγμα που πέτυχε;», αλλά «το παράδειγμα περιέχει πιστοποιημένη μετάβαση από κατάσταση συμβατή με αυτή που έφτασε ο agent;».

Για marketing, e-commerce και business teams που σχεδιάζουν agentic workflows, αυτή η διάκριση μπορεί να αποτρέψει μια ύπουλη κατηγορία σφαλμάτων: τον agent που ακολουθεί πειθαρχημένα μια καλή διαδικασία σε λάθος σημείο. Η πιο ώριμη καθοδήγηση δεν δίνει πάντα απάντηση. Μερικές φορές αναγνωρίζει ότι δεν έχει το σωστό reference για την παρούσα κατάσταση και αφήνει έναν άλλο μηχανισμό να αποφασίσει.

Business Automation & AI by TWO DOTS

Σχεδιάστε AI workflows που ξέρουν πότε ένα reference είναι πραγματικά εφαρμόσιμο.

Η TWO DOTS οργανώνει state, preconditions, επιτρεπτές ενέργειες και human fallback ώστε ένας agent να μην εφαρμόζει τη σωστή διαδικασία στο λάθος σημείο.

Frequently Asked Questions (FAQs)

Τι είναι το state–reference mismatch;

Είναι η ασυμβατότητα ανάμεσα στην κατάσταση που έχει φτάσει ένας agent και στην κατάσταση από την οποία είναι έγκυρη η επόμενη ενέργεια μιας επιτυχημένης διαδρομής αναφοράς.

Τι κάνει διαφορετικά το SMRC-SD;

Ελέγχει αν η τρέχουσα κατάσταση υποστηρίζεται από το reference, ενεργοποιεί distillation μόνο στους matched γύρους και δίνει στον teacher την πλήρη διαδρομή, μια περίληψη του πραγματικού state και μια grounded υποψήφια συνέχεια.

Σταματά η εκπαίδευση στους unmatched γύρους;

Όχι. Οι γύροι συνεχίζουν να εκπαιδεύονται με GRPO. Αφαιρείται μόνο το reference-conditioned self-distillation signal όταν δεν υπάρχει συμβατή τοπική βάση.

Ποια benchmarks χρησιμοποιήθηκαν;

Η εργασία χρησιμοποίησε το ALFWorld για διαδραστικές οικιακές εργασίες και το WebShop για αναζήτηση και αγορά προϊόντων, με 128 επίσημα test tasks και τέσσερα rollouts ανά task.

Το state matching γίνεται με embeddings;

Όχι στην εργασία. Χρησιμοποιούνται ντετερμινιστικοί, environment-specific adapters, κατευθυντικοί έλεγχοι πεδίων και επιβεβαίωση ότι η υποψήφια ενέργεια είναι διαθέσιμη.

Υπάρχει πρόσθετο κόστος στο inference;

Όχι στην προτεινόμενη μέθοδο. References, signatures, matching, candidates και teacher context χρησιμοποιούνται μόνο στην εκπαίδευση και αφαιρούνται στο deployment.

Μπορούν τα αποτελέσματα να μεταφερθούν άμεσα σε εμπορικούς agents;

Όχι ως εγγύηση. Οι μετρήσεις αφορούν συγκεκριμένα benchmarks, μοντέλα και adapters. Η αρχή της state-compatible guidance χρειάζεται domain-specific state model, safeguards και νέα αξιολόγηση.

Ποιο είναι το βασικό product lesson;

Μην εφαρμόζετε μια επιτυχημένη διαδικασία χωρίς να ελέγξετε αν οι προϋποθέσεις της ισχύουν τώρα. Η αποχή από μη συμβατή καθοδήγηση μπορεί να είναι ασφαλέστερη από μια αναγκαστική συνέχεια.

Newsletter

Enter your email address below to subscribe to our newsletter