С повече от 20 години опит ние променяме вашето цифрово присъствие. Специализирани сме в разработването на уебсайтове и електронни магазини, SEO и цифров маркетинг, ERP софтуер и интелигентна автоматизация, които извеждат бизнеса ви на следващото ниво.
Μια αποτυχημένη διαδρομή αποκτά αξία μόνο όταν μετατρέπεται σε πλήρη και επαληθευμένη επίδειξη.
Отговор първо: Το PROOF-Gen δεν εκπαιδεύει έναν AI agent πάνω στις αποτυχίες του αυτούσιες. Χρησιμοποιεί το trace και το feedback του verifier για να ανακτήσει μια πλήρη, επιτυχημένη διαδρομή, αφαιρεί την προσωρινή καθοδήγηση και κρατά μόνο την καθαρή επίδειξη για distillation. Η αξία βρίσκεται στη μετατροπή ενός near-miss σε ελέγξιμο training signal.
Το PROOF-Gen ανακτά επιτυχημένες διαδρομές από failures AI agents και τις μετατρέπει σε καθαρά δεδομένα για πιο ασφαλές model distillation με έλεγχο.
Τι αξία έχει ένας AI agent που εκτελεί σωστά σχεδόν όλα τα βήματα μιας εργασίας, αλλά αποτυγχάνει στο ένα βήμα που κρίνει το τελικό αποτέλεσμα; Στα περισσότερα generate-and-filter pipelines η διαδρομή απορρίπτεται ολόκληρη. Η εργασία PROOF-Gen: From Optimized Data to Better Distillation των Anh Ta, Junjie Zhu και Shahin Shayandeh υποστηρίζει ότι έτσι χάνονται ακριβώς τα δύσκολα σενάρια που ένα μικρότερο μοντέλο πρέπει να μάθει να ολοκληρώνει.
Το PROOF-Gen, από το Per-scenario Reflective Optimization to Overcome Failed Generation, παρεμβάλλει ένα στάδιο ανάκτησης πριν από το supervised fine-tuning. Ένας reflector διαβάζει το αποτυχημένο execution trace και το feedback των evaluators, παράγει προσωρινή διορθωτική καθοδήγηση και οδηγεί τον ίδιο executor σε νέα εκτέλεση από την αρχή. Αν όλοι οι έλεγχοι περάσουν, η καθοδήγηση αφαιρείται πριν από την εκπαίδευση του student.
Η συνηθισμένη πρώτη φάση του model distillation για tool-calling agents είναι supervised fine-tuning πάνω σε διαδρομές που παράγει ένα ισχυρό teacher model. Το pipeline εκτελεί κάθε εργασία, ελέγχει το τελικό αποτέλεσμα και κρατά μόνο τα traces που πέρασαν. Η λογική προστατεύει το training set από εμφανώς λανθασμένα παραδείγματα, αλλά ένα δυαδικό φίλτρο αντιμετωπίζει το ίδιο μια εκτέλεση που απέτυχε αμέσως και μια εκτέλεση που ολοκλήρωσε τέσσερα από τα πέντε απαραίτητα βήματα.
Στην ανάλυση της εργασίας πάνω στο τ2-bench, 473 από 834 trials απέτυχαν. Από αυτές τις αποτυχίες, το 67% είχε εκτελέσει σωστά πάνω από τις μισές απαιτούμενες tool calls. Οι ερευνητές περιγράφουν near-misses όπου ο agent είχε χειριστεί τις ρουτίνες αλλά παρέλειψε μία κρίσιμη ενέργεια, όπως ένα roaming toggle, μια άδεια SMS ή ένα data refuel. Μία παράλειψη αρκούσε για λάθος environment ή database state.
Αυτό έχει άμεση επιχειρησιακή σημασία. Σε υποστήριξη πελατών, e-commerce operations ή εσωτερικά workflows, ένα training set που κρατά μόνο τις εύκολες επιτυχίες γίνεται καθρέφτης όσων ο teacher ήδη λύνει. Τα δύσκολα σημεία απόφασης απουσιάζουν, παρότι εκεί συγκεντρώνεται ο πραγματικός κίνδυνος. Η διάκριση ανάμεσα στη σωστή απάντηση και στο σωστό artifact φαίνεται και στο K-Bench για την αξιολόγηση AI agents.
Πώς λειτουργεί το PROOF-Gen
Για κάθε αποτυχημένο task, ο reflector λαμβάνει ολόκληρο το execution trace και το feedback του verifier: ποιο assertion απέτυχε, ποια κατάσταση έμεινε λανθασμένη και πού χρειάζεται άλλη απόφαση. Στη συνέχεια γράφει ένα προσωρινό cheatsheet με διαδικαστική καθοδήγηση, όπως τη σωστή σειρά εργαλείων ή την προϋπόθεση που αγνοήθηκε.
Ο executor ξεκινά την εργασία από την αρχή με αυτή την καθοδήγηση. Αν αποτύχει ξανά, ο reflector αναθεωρεί το cheatsheet και ακολουθεί νέα προσπάθεια, έως δέκα iterations στο πείραμα. Η βελτιστοποίηση γίνεται ανά σενάριο. Σε αντίθεση με ένα γενικό prompt optimization που αναζητά οδηγίες για πολλά inputs, εδώ το prompt επιτρέπεται να υπερπροσαρμοστεί σε μία εργασία, επειδή είναι προσωρινό και θα απορριφθεί.
Το προϊόν δεν είναι το cheatsheet αλλά η επιτυχημένη trajectory. Πριν μπει στο training set, η προσωρινή καθοδήγηση αφαιρείται. Ο student βλέπει τις αποφάσεις, τις tool calls και το τελικό αποτέλεσμα, όχι τη σκαλωσιά που βοήθησε τον teacher να τα παράγει. Έτσι το pipeline επιδιώκει να μεταφέρει συμπεριφορά επίλυσης χωρίς να αντιγράφει task-specific υποδείξεις.
Generate-and-filter
Κρατά μόνο ό,τι πέτυχε στην πρώτη εκτέλεση. Είναι απλό, αλλά αφήνει τα δύσκολα failures χωρίς training signal.
Binary filterΕύκολα cases
Partial-credit training
Μαθαίνει από σωστές ενδιάμεσες ενέργειες, χωρίς απαραίτητα να δείχνει την πλήρη διαδρομή μέσα από το κρίσιμο decision point.
Tool accuracyΑτελές τέλος
PROOF-Gen recovery
Χρησιμοποιεί reflection για να παράγει ολοκληρωμένη, επαληθευμένη trajectory και αφαιρεί το προσωρινό scaffold πριν από το SFT.
VerifierEnd-to-end
Τι έδειξαν τ2-bench και BFCL
Στο telecom training pool του τ2-bench υπήρχαν 2.171 εργασίες. Ο GPT-4o teacher πέρασε αρχικά 158 και απέτυχε σε 2.013. Οι ερευνητές έστειλαν 300 failures στο recovery loop και ανέκτησαν 279, δηλαδή 93%. Οι 264 αποδόθηκαν στην καθοδήγηση του cheatsheet και οι 15 σε επιτυχημένο stochastic replay του user simulator. Το τελικό telecom training set περιείχε 437 trajectories, από τις οποίες το 64% προήλθε από recovery.
Στο BFCL v4 multi-turn, ο teacher πέρασε 296 από 560 training tasks. Η μέθοδος εφαρμόστηκε και στις 264 αποτυχίες και ανέκτησε 89, ποσοστό 33,7%. Η χαμηλότερη ανάκτηση δεν αναιρεί την αρχή· δείχνει ότι το difficulty distribution και η δυνατότητα του verifier αλλάζουν το αποτέλεσμα. Το recovery rate πρέπει να διαβάζεται πάντα μαζί με το αρχικό failure pool.
Με combined training, το Qwen3-4B-Instruct-2507 βελτιώθηκε στο τ2-bench από Pass@1 0,132 σε 0,529. Το paper αναφέρει επίσης βελτίωση 7,2 ποσοστιαίων μονάδων για το Gemma 4 E4B-it στο BFCL v4 multi-turn. Αυτά είναι αποτελέσματα δύο benchmark setups, όχι γενικό claim ότι κάθε μικρό μοντέλο θα αποκτήσει την ίδια βελτίωση.
Τεκμηριωμένο scope
Τέσσερα μεγέθη του PROOF-Gen
Οι τιμές προέρχονται από τη συγκεκριμένη εργασία και περιγράφουν datasets, recovery και downstream evaluation. Δεν είναι benchmark αγοράς ή υπόσχεση ROI.
57%Teacher trials που απέτυχαν στην ανάλυση τ2-bench
93%Recovery σε 300 επιλεγμένα telecom failures
0,132 → 0,529Pass@1 του Qwen στο τ2-bench με combined training
+7,2 μονάδεςTask accuracy gain του Gemma στο BFCL v4 multi-turn
Γιατί το partial credit δεν αρκεί
Μια φυσική εναλλακτική είναι να κρατηθούν οι σωστές επιμέρους ενέργειες και να δοθεί partial credit. Η εργασία αναφέρει ότι το filtered-only training αύξησε την action accuracy περίπου κατά 25 ποσοστιαίες μονάδες, αλλά δεν βελτίωσε το end-to-end task completion σε κανένα από τα τέσσερα ζεύγη μοντέλου και benchmark.
Για το Qwen στο telecom benchmark, η action accuracy ανέβηκε από 41,4% σε 66,3% με filtered-only QLoRA, ενώ η environment accuracy έμεινε ουσιαστικά στάσιμη, από 23,5% σε 22,6%. Με το combined dataset, που περιλάμβανε recovered trajectories, οι αντίστοιχες τιμές έφτασαν 83,3% και 54,5%. Η database accuracy ανέβηκε από 9,3% σε 15,6%.
Η επιχειρησιακή μετάφραση είναι απλή: ένας agent μπορεί να φαίνεται δραστήριος και να καλεί πολλά σωστά APIs χωρίς να ολοκληρώνει την υπόθεση. Αν μια αλλαγή διεύθυνσης, επιστροφή ή ακύρωση καταλήγει σε λάθος τελική κατάσταση, το πλήθος των σωστών tool calls δεν σώζει το workflow. Γι’ αυτό η συμπεριφορική δοκιμή των AI agents χρειάζεται end-to-end assertions και όχι μόνο partial metrics.
Κανόνας αξιολόγησης
Μην προωθείτε agent επειδή βελτιώθηκε μόνο η tool-call accuracy
Απαιτήστε σωστή τελική κατάσταση, policy compliance, provenance των tool arguments και επανάληψη σε holdout tasks. Η ενδιάμεση ακρίβεια είναι διαγνωστική· το release gate πρέπει να μετρά αν ολοκληρώθηκε η πραγματική εργασία χωρίς παραβίαση.
Η ποιότητα του reflector καθορίζει το recovery
Το recovery δεν προέκυψε από τυφλή επανάληψη. Σε ablation 82 αποτυχημένων σεναρίων από airline, retail και telecom, η αυτοκριτική του GPT-4o ανέκτησε 20 από τα 82, ή 24,4%. Με GPT-5.1 ως reflector, ανακτήθηκαν 80 από τα 82, ή 97,6%, ενώ ο executor και οι υπόλοιπες συνθήκες έμειναν σταθερές.
Η σύγκλιση ήταν γρήγορη. Από τις 264 cheatsheet-driven ανακτήσεις στο telecom run, το 58,7% πέτυχε στο πρώτο iteration και το 84,1% έως το τρίτο. Όσα σενάρια έμεναν άλυτα μετά τα πρώτα iterations σπάνια σώζονταν αργότερα. Η σωστή διάγνωση της αιτίας αξίζει περισσότερο από πολλές ανεξέλεγκτες παραλλαγές του ίδιου prompt.
Η εργασία συγκρίνει επίσης direct execution από ισχυρότερο μοντέλο με το σχήμα ισχυρός reflector και φθηνότερος executor. Στα 300 δύσκολα telecom tasks, το GPT-5.1 με high reasoning έλυσε 250, ενώ ο συνδυασμός GPT-4o executor και GPT-5.1 reflector ανέκτησε 279 χρησιμοποιώντας το ακριβότερο μοντέλο μόνο για reflection, κατά μέσο όρο 2,2 calls ανά σενάριο. Το οικονομικό όφελος εξαρτάται από τιμές, μήκος trajectories και ποσοστό ανάκτησης· πρέπει να μετρηθεί, όχι να υποτεθεί.
Αυτή η αρχιτεκτονική μοιάζει με τη λογική actor, judge και editor: διαφορετικός ρόλος εκτελεί, διαφορετικός ελέγχει και διαφορετικός προτείνει διορθώσεις. Η σχετική προσέγγιση αναλύεται στο Actor, Judge, Editor για ελεγχόμενο AI σχεδιασμό.
Capability και brand voice μπορούν να διαχωριστούν
Ένα ενδιαφέρον εύρημα για product teams είναι ότι ο reflector μπορεί να βελτιώσει το τι κάνει ο agent χωρίς να επιβάλλει τον δικό του τρόπο επικοινωνίας. Στα matched telecom tasks της εργασίας, ο GPT-4o με cheatsheet διατήρησε το σύντομο, σταδιακό στιλ του, ενώ η direct execution από το ισχυρότερο μοντέλο παρήγαγε πιο εκτενή πρωτόκολλα.
Το cheatsheet αλλάζει τη σειρά και την επιλογή ενεργειών, όχι αναγκαστικά τη φωνή του executor. Για ένα brand αυτό είναι ουσιαστικό. Η βελτίωση της κάλυψης ενός customer-service agent δεν χρειάζεται να μετατρέψει όλες τις απαντήσεις σε μακροσκελή τεχνικά manuals. Η επιλογή του executor παραμένει μοχλός για tone, latency και interaction design, ενώ ο reflector λειτουργεί ως μηχανισμός επίλυσης δύσκολων περιπτώσεων.
Ο διαχωρισμός αυτός δεν εξαλείφει την ανάγκη για UX testing. Ένα agent μπορεί να ολοκληρώνει σωστά την εργασία αλλά να ζητά ασαφή confirmations, να αποκαλύπτει εσωτερική ορολογία ή να δημιουργεί περιττή τριβή. Για αυτό η αξιολόγηση πρέπει να καλύπτει outcome, ασφάλεια και συνομιλιακή εμπειρία, όπως και στην επιλογή AI агент за обслужване на клиенти.
Ο έλεγχος για shortcuts και διαρροή
Το κρίσιμο ρίσκο είναι ένα cheatsheet να δώσει στον teacher στοιχεία που κανονικά έπρεπε να ανακαλύψει μέσω εργαλείων. Τότε η recovered trajectory θα έμοιαζε επιτυχημένη αλλά θα δίδασκε στον student να χρησιμοποιεί magic values, μελλοντική πληροφορία ή μη νόμιμες παρακάμψεις.
Οι συγγραφείς έλεγξαν recovered trajectories με δύο ανεξάρτητους judges για hardcoded values, shortcuts και χρήση μελλοντικής πληροφορίας και εξέτασαν χειροκίνητα τις αποκλίσεις. Το audit δεν αποτελεί απόλυτη εγγύηση για κάθε νέο dataset. Υποδεικνύει όμως τη σωστή αρχιτεκτονική: κάθε tool argument πρέπει να μπορεί να αποδοθεί στο αίτημα, σε προηγούμενο tool return ή σε νόμιμο schema default.
Η ίδια απαίτηση ισχύει και μετά την εκπαίδευση. Logs, evaluator results και policy decisions χρειάζονται lineage ώστε η ομάδα να ξέρει γιατί ένα trace χαρακτηρίστηκε αποδεκτό. Η ανάγκη αυτή συνδέεται με το αποδεικτικό κάθε απόφασης ενός AI runtime και με τη διακυβέρνηση των δεδομένων που μπαίνουν στο training set.
Τι σημαίνει για production AI agents
Στο production σύστημα που περιγράφει η εργασία, το PROOF-Gen εφαρμόστηκε σε χιλιάδες σενάρια, με μεγαλύτερες διαδρομές και πολλαπλούς evaluators. Οι συγγραφείς αναφέρουν άνοδο 6,3 ποσοστιαίων μονάδων στο goal completion της ποιότητας trajectories. Σε deployed on-device μοντέλο αναφέρουν +1,5 μονάδα στο goal completion, βελτιώσεις +1,7 έως +5,0 μονάδες σε response-quality metrics και μέση βελτίωση +1,48 μονάδα στις μη αγγλικές γλώσσες.
Οι αριθμοί περιγράφουν τη συγκεκριμένη ερευνητική και παραγωγική εγκατάσταση. Δεν αποτελούν πρόβλεψη για άλλη εταιρεία. Η μεταφέρσιμη ιδέα είναι ότι τα failure logs μπορούν να γίνουν ουρά υποψηφίων training examples, εφόσον υπάρχουν πλήρη traces, αξιόπιστοι verifiers, σαφές provenance και αυστηρή αφαίρεση του scaffold.
Σε e-commerce, υποψήφια cases είναι η αλλαγή διεύθυνσης πριν από την αποστολή, η μερική επιστροφή, η ακύρωση με πολιτικές εξαιρέσεων, ο έλεγχος διαθεσιμότητας ή ένας συνδυασμός CRM και logistics. Το σωστό unit αξιολόγησης δεν είναι πόσες API calls ήταν ορθές, αλλά αν το σύστημα πέτυχε την επιθυμητή επιχειρησιακή κατάσταση χωρίς παραβίαση πολιτικής.
Η προτεραιοποίηση των failures χρειάζεται και οικονομικό φίλτρο. Δεν αξίζει κάθε σπάνιο edge case το ίδιο recovery budget. Η ομάδα πρέπει να συνδέει συχνότητα, κόστος λάθους, ρυθμιστικό κίνδυνο και πιθανότητα ανάκτησης, όπως σε μια σοβαρή ανάλυση AI ROI από τα tokens στην αξία της εργασίας.
Επτά βήματα για ελέγξιμο recovery pipeline
Η εφαρμογή δεν ξεκινά από το fine-tuning αλλά από την παρατηρησιμότητα και τους verifiers. Το ακόλουθο πρωτόκολλο μεταφέρει την ιδέα σε επιχειρησιακούς agents χωρίς να θεωρεί κάθε failure κατάλληλο για training.
Από το failure log σε επαληθευμένο training example
Стъпка 1Καταγράψτε πλήρες execution trace
Αποθηκεύστε αίτημα, model και version, system prompt, tool inputs και outputs, timestamps, evaluator results και τελική κατάσταση. Χωρίς πλήρες trace ο reflector δεν μπορεί να εντοπίσει τη ρίζα του λάθους.
Стъпка 2Ορίστε programmatic end-to-end verifiers
Ελέγξτε αν ενημερώθηκε η σωστή εγγραφή, εφαρμόστηκε η πολιτική, ζητήθηκε το απαιτούμενο confirmation και προέκυψε η επιθυμητή business state. Μην αρκεστείτε σε judge της τελικής απάντησης.
Стъпка 3Ταξινομήστε failure cause και business risk
Διαχωρίστε missing tool call, λάθος σειρά, εσφαλμένο argument, policy violation, verifier ambiguity και tool outage. Δώστε προτεραιότητα σε συχνά ή υψηλού κόστους cases που μπορούν να αναπαραχθούν.
Стъпка 4Απομονώστε το προσωρινό scaffold
Βάλτε σαφή delimiters στο per-scenario cheatsheet, μην το εμφανίζετε στον χρήστη και μην το καταγράφετε ως μέρος της τελικής demonstration. Η guidance πρέπει να είναι διαδικαστική, όχι απάντηση με κρυφές τιμές.
Стъпка 5Επανεκτελέστε από καθαρή αρχική κατάσταση
Μην συνεχίζετε από μισοαλλαγμένη βάση. Επαναφέρετε sandbox, fixtures και conversation state ώστε η νέα trajectory να αποδεικνύει ότι ολοκληρώνει αυτόνομα την εργασία.
Стъпка 6Ελέγξτε provenance και αφαιρέστε το cheatsheet
Αποδείξτε την πηγή κάθε tool argument, τρέξτε όλους τους verifiers και αφαιρέστε πλήρως την προσωρινή καθοδήγηση πριν από το dataset export. Απορρίψτε shortcuts και magic values.
Стъпка 7Κρατήστε holdout release gate
Μετρήστε goal completion, policy compliance, latency, κόστος και εμπειρία χρήστη σε unseen tasks. Αν βελτιώνεται μόνο η tool-call accuracy, το νέο μοντέλο δεν περνά σε production.
Το πρωτόκολλο χρειάζεται περιορισμούς πρόσβασης και ασφαλή sandboxes. Ένα recovery loop που επαναλαμβάνει πραγματικές ενέργειες χωρίς isolation μπορεί να δημιουργήσει διπλές παραγγελίες, λανθασμένες επιστροφές ή μη αναστρέψιμες αλλαγές. Η αρχιτεκτονική ελάχιστης πρόσβασης για τέτοια συστήματα αναλύεται στο άρθρο για δυναμικά δικαιώματα AI agents.
Όρια, κόστος και governance
Η μελέτη χρησιμοποίησε έναν teacher, τον GPT-4o, και reflectors από τον ίδιο provider. Δεν έχει αποδειχθεί ότι η ίδια σχέση reflector quality και recovery ισχύει με κάθε οικογένεια μοντέλων ή open-weight σύστημα. Τα cheatsheets μπορεί να είναι μεγάλα, άρα ο executor χρειάζεται αρκετό context και αξιόπιστη instruction following.
Τα benchmarks έχουν επίσης συγκεκριμένη κλίμακα και στοχαστικότητα. Στο BFCL οι επιμέρους κατηγορίες περιλαμβάνουν περιορισμένο αριθμό test tasks, ενώ το τ2-bench χρησιμοποιεί stochastic user simulator. Για αυτό το paper διαχωρίζει το headline 93% από το 88% που αποδίδεται άμεσα στο cheatsheet. Κάθε ομάδα χρειάζεται επαναλήψεις και confidence intervals, όχι μόνο ένα recovery percentage.
Το PROOF-Gen δεν εξαφανίζει το κόστος. Προσθέτει reflection, επανεκτελέσεις, verifier compute, human audit και dataset governance. Η αξία του εξαρτάται από το αν η ανάκτηση δύσκολων cases είναι φθηνότερη και χρησιμότερη από περισσότερα εύκολα traces ή από direct execution με ισχυρότερο μοντέλο σε κάθε turn.
Τέλος, ένας κακός verifier μπορεί να βελτιστοποιήσει το λάθος πράγμα. Αν ο στόχος επιβραβεύει μόνο τη μεταβολή της βάσης και αγνοεί συναίνεση, πολιτική ή ποιότητα απάντησης, το recovery loop μπορεί να παράγει συνεπείς αλλά μη αποδεκτές διαδρομές. Η governance πρέπει να συνδέει context, measurement και risk management, όχι να εμφανίζεται στο τέλος ως compliance checklist. Η ίδια αρχή βρίσκεται στις εκτελέσιμες πολιτικές AI safety.
Η αποτυχία ως training signal
Το PROOF-Gen μετακινεί το bottleneck του distillation προς τα δεδομένα. Ένας καλύτερος optimizer δεν μπορεί να μάθει τη διαδρομή μέσα από το κρίσιμο decision point αν το training set την έχει ήδη πετάξει. Πρώτα χρειάζονται πλήρεις, επαληθευμένες demonstrations για τις περιπτώσεις που ο teacher δεν έλυσε στην πρώτη προσπάθεια.
Για τις επιχειρήσεις, το μήνυμα είναι πρακτικό: ένα αποτυχημένο workflow περιέχει συχνά μεγάλο μέρος της σωστής διαδικασίας και ένα πολύτιμο σημάδι για το κενό που μένει. Με αξιόπιστους verifiers, ισχυρό reflection, καθαρό provenance, αφαίρεση του scaffold και holdout αξιολόγηση, αυτό το κενό μπορεί να γίνει νέο training signal.
Η αποτυχία δεν πρέπει να μπει αυτούσια στην εκπαίδευση και δεν πρέπει να ρομαντικοποιηθεί. Πρέπει να μετατραπεί σε επιτυχημένη, αναπαραγώγιμη και ελέγξιμη επίδειξη. Αυτή είναι η διαφορά ανάμεσα σε ένα log που απλώς εξηγεί τι πήγε στραβά και σε ένα dataset που κάνει τον επόμενο agent πραγματικά πιο αξιόπιστο.
AI agents με ελέγξιμα outcomes
Μετατρέψτε τα failure logs σε ασφαλές πλάνο βελτίωσης
Η TWO DOTS σχεδιάζει επιχειρησιακούς AI αυτοματισμούς με πλήρη traces, programmatic verifiers, περιορισμένα tool permissions, evaluation gates και human review. Έτσι κάθε recovery experiment συνδέεται με πραγματικό business outcome και μπορεί να ελεγχθεί πριν από το production.
Είναι μέθοδος ανάκτησης επιτυχημένων tool-calling trajectories από αποτυχημένες εκτελέσεις, με reflective prompt optimization ξεχωριστά για κάθε σενάριο.
Εκπαιδεύεται ο student πάνω στο cheatsheet;
Όχι. Η προσωρινή καθοδήγηση αφαιρείται πριν από το supervised fine-tuning και ο student βλέπει μόνο την καθαρή, επιτυχημένη trajectory.
Γιατί δεν αρκεί η tool-call accuracy;
Επειδή πολλές σωστές ενδιάμεσες ενέργειες μπορούν να συνυπάρχουν με λάθος τελική κατάσταση. Το release gate πρέπει να μετρά end-to-end goal completion και policy compliance.
Ποιο ήταν το βασικό recovery rate;
Στο δείγμα 300 telecom failures ανακτήθηκαν 279, δηλαδή 93%. Οι 264 αποδόθηκαν στο cheatsheet και οι 15 σε stochastic replay του user simulator.
Μπορεί το PROOF-Gen να χρησιμοποιηθεί σε επιχειρησιακούς agents;
Η λογική εφαρμόζεται όπου υπάρχουν πλήρη traces, αξιόπιστοι verifiers, ασφαλές περιβάλλον επανεκτέλεσης και δυνατότητα ελέγχου της τελικής επιχειρησιακής κατάστασης.
Ποιο είναι το βασικό ρίσκο στα recovered traces;
Να εισαχθούν shortcuts, magic values ή μελλοντική πληροφορία. Κάθε tool argument χρειάζεται αποδεδειγμένη προέλευση από το αίτημα, tool return ή εγκεκριμένο default.
Αντικαθιστά το PROOF-Gen το fine-tuning;
Όχι. Είναι στάδιο παραγωγής και ανάκτησης δεδομένων πριν από το fine-tuning. Στη μελέτη, το downstream training έγινε με QLoRA για τρία epochs.
Ποιες μετρήσεις πρέπει να παρακολουθεί μια εταιρεία;
Goal completion, σωστή τελική κατάσταση, policy compliance, provenance, κόστος, latency και εμπειρία χρήστη. Η tool-call accuracy παραμένει βοηθητική διαγνωστική μέτρηση.