Το LOTAPO εκπαιδεύει έναν AI agent να ξεχωρίζει ποια ενδιάμεση αναζήτηση βοήθησε πραγματικά την τελική απάντηση και ποια ήταν περιττή ή επιζήμια. Αντί να επιβραβεύει ολόκληρη τη διαδρομή επειδή το τελευταίο αποτέλεσμα ήταν σωστό, αφαιρεί αναδρομικά ένα search turn, διατηρεί όλα τα επόμενα βήματα και μετρά πόσο αλλάζει η πιθανότητα της γνωστής σωστής απάντησης.
Για τις επιχειρήσεις, το ουσιαστικό μήνυμα δεν είναι ότι υπάρχει ένα έτοιμο εμπορικό εργαλείο. Είναι ότι η αξιολόγηση ενός agent χρειάζεται να εξετάζει και τη διαδικασία: ποιες πηγές χρησιμοποίησε, ποιες κλήσεις εργαλείων πρόσθεσαν αξία, ποια βήματα αύξησαν κόστος χωρίς όφελος και πότε απαιτείται ανθρώπινος έλεγχος πριν από μια πραγματική ενέργεια.
Σημείωση έκδοσης: το αρχικό draft και η πρώτη έκδοση της εργασίας χρησιμοποιούσαν το όνομα LAPO. Η τρέχουσα έκδοση arXiv v2 της 16ης Ιουλίου 2026 ονομάζει τη μέθοδο LOTAPO — Leave-One-Turn Attribution for Policy Optimization — και αυτήν ακολουθεί το άρθρο.
Τι είναι το LOTAPO και ποιο πρόβλημα λύνει
Σε ένα multi-turn search workflow, το μοντέλο δεν λαμβάνει απλώς ένα ερώτημα και απαντά. Διατυπώνει query, λαμβάνει αποσπάσματα, ερμηνεύει τα ευρήματα, αποφασίζει αν χρειάζεται νέα αναζήτηση και τελικά συνθέτει απάντηση. Η επιτυχία εξαρτάται από αλληλεξαρτώμενες κινήσεις: ένα πρώιμο στοιχείο μπορεί να αποκτήσει αξία μόνο όταν συνδυαστεί με μεταγενέστερη πληροφορία.
Η απλή ανταμοιβή τελικού αποτελέσματος δεν ξεχωρίζει ποιο turn ήταν χρήσιμο, ποιο επανέλαβε όσα ήταν ήδη γνωστά και ποιο έστρεψε τη διαδικασία σε λάθος κατεύθυνση. Μια σωστή τελική απάντηση μπορεί έτσι να ενισχύσει και κακές ενδιάμεσες κινήσεις. Αντίστροφα, μια λανθασμένη απάντηση μπορεί να τιμωρήσει ένα turn που είχε ανακτήσει το κρίσιμο στοιχείο αλλά δεν αξιοποιήθηκε σωστά αργότερα.
Το LOTAPO αντιμετωπίζει αυτό το credit-assignment πρόβλημα με process supervision που παράγεται από την ίδια την τρέχουσα policy. Δεν χρειάζεται ξεχωριστό reward model, teacher, verifier ή LLM-as-a-Judge. Χρειάζεται όμως γνωστή σωστή απάντηση, καταγεγραμμένη trajectory και επιπλέον υπολογισμό για τα πλήρη και τα counterfactual contexts.
Η διάκριση είναι σημαντική όταν μια ομάδα σχεδιάζει RAG, agents και αυτοματοποιημένα workflows. Το τελικό output είναι μόνο ένα επίπεδο αξιολόγησης· η ποιότητα των ενδιάμεσων αναζητήσεων και η χρήση των πηγών είναι ξεχωριστό επίπεδο.
Πώς λειτουργεί το leave-one-turn attribution
Αφού ολοκληρωθεί μια trajectory, το LOTAPO αξιολογεί κάθε έγκυρο search turn. Αντικαθιστά ολόκληρη την ενέργεια αναζήτησης και το αντίστοιχο retrieval observation με το σταθερό σύμβολο [DELETE]. Όλες οι προηγούμενες και επόμενες αλληλεπιδράσεις παραμένουν στην ίδια σειρά.
Στη συνέχεια συγκρίνει τη μέση log-likelihood της gold answer στο πλήρες context με τη μέση log-likelihood της ίδιας απάντησης στο context όπου λείπει το συγκεκριμένο turn. Η διαφορά ονομάζεται Answer-Likelihood Gain. Η μέτρηση γίνεται μόνο στα tokens της gold answer και κανονικοποιείται ως μέσος όρος, ώστε το μήκος της απάντησης να επηρεάζει λιγότερο την κλίμακα.
Θετικό gain σημαίνει ότι η αφαίρεση του turn μείωσε την πιθανότητα της σωστής απάντησης: το turn είχε θετική απόδοση στο συγκεκριμένο context και για τη συγκεκριμένη policy. Αρνητικό gain σημαίνει ότι η αφαίρεση αύξησε την πιθανότητα της σωστής απάντησης, άρα το turn μπορεί να ήταν επιζήμιο. Τιμή κοντά στο μηδέν δείχνει μικρή παρατηρημένη επίδραση.
Το αρχικό final-answer turn εξαιρείται από το context βαθμολόγησης. Έτσι η τελική σκέψη και η ήδη παραχθείσα απάντηση δεν διαρρέουν στη μέτρηση. Η αξιολόγηση αφορά την υποστήριξη που παρείχαν οι προηγούμενες search interactions.
Αναδρομική έναντι άμεσης απόδοσης
Μια forward προσέγγιση συγκρίνει την κατάσταση αμέσως πριν και αμέσως μετά την προσθήκη ενός turn. Αυτό μετρά την τοπική μεταβολή, αλλά μπορεί να χάσει την καθυστερημένη χρησιμότητα. Σε σύνθετη αναζήτηση, ένα εύρημα ίσως αρχικά δημιουργήσει αβεβαιότητα και αργότερα επιτρέψει αποσαφήνιση οντοτήτων ή σύνδεση δύο πηγών.
Δύο διαφορετικοί τρόποι απόδοσης αξίας σε ένα search turn
Το paper παρουσιάζει το ερώτημα για τον κεντρικό χαρακτήρα του Green Eggs and Ham. Ένα turn ανακτά το κρίσιμο στοιχείο για τον Sam-I-Am, αλλά η forward μέτρηση του δίνει αρνητική απόδοση. Όταν το ίδιο turn αξιολογείται με το πλήρες μεταγενέστερο context, το LOTAPO εντοπίζει θετική συνεισφορά, επειδή η πληροφορία βοήθησε την τελική διάκριση των χαρακτήρων.
Αυτό δεν σημαίνει ότι κάθε παλιό query είναι χρήσιμο. Σημαίνει ότι ένα query δεν πρέπει να κρίνεται αποκλειστικά από την άμεση αλλαγή στην απάντηση, όταν ο ρόλος του είναι να προετοιμάσει το επόμενο βήμα.
Τι προστατεύει το sign-consistency gating
Τα raw attribution scores διαφέρουν σε κλίμακα μεταξύ ερωτήσεων και trajectories. Το LOTAPO εφαρμόζει robust scaling με βάση τη διάμεσο των μη μηδενικών απόλυτων gains, τα περιορίζει με υπερβολική εφαπτομένη και κατόπιν τα κανονικοποιεί μέσα στην ομάδα των rollouts του ίδιου ερωτήματος.
Η ομαδική κανονικοποίηση όμως μπορεί να αλλάξει την κατεύθυνση ενός signal. Ένα αρνητικό raw gain μπορεί να φαίνεται θετικό επειδή είναι καλύτερο από τον μέσο όρο της ομάδας. Αν το training χρησιμοποιούσε αυτό το αποτέλεσμα χωρίς φίλτρο, θα μπορούσε να επιβραβεύσει turn που το ίδιο counterfactual test έδειξε ως αρνητικό.
Το sign-consistency gate διατηρεί την πρόσθετη process advantage μόνο όταν το raw gain και το normalized signal έχουν την ίδια μη μηδενική κατεύθυνση. Αν διαφωνούν ή το raw attribution είναι μηδέν, η πρόσθετη ενημέρωση μηδενίζεται. Στα δύο παραδείγματα της εργασίας, raw attribution 0,000 μετατράπηκε από την κανονικοποίηση σε +0,550 και −0,558· το gate απέκλεισε και τις δύο αδικαιολόγητες ενημερώσεις.
Γιατί το gate έχει σημασία
Η σχετική κατάταξη ενός turn μέσα σε μια ομάδα δεν πρέπει να αναιρεί την κατεύθυνση του ίδιου του counterfactual evidence.
Το LOTAPO κρατά τη σύγκριση μεταξύ rollouts, αλλά δεν αφήνει το normalization να μετατρέψει μηδενική ή αρνητική συνεισφορά σε αντίθετη πολιτική ενημέρωση.
Πώς συνδέεται με το GRPO
Η μέθοδος διατηρεί την trajectory-level ανταμοιβή. Η ποιότητα της τελικής απάντησης υπολογίζεται με answer-level F1 και τυποποιείται μέσα στα πέντε rollouts του ίδιου prompt. Αυτή η outcome advantage εξακολουθεί να εφαρμόζεται σε όλα τα policy-generated tokens.
Στα tokens κάθε έγκυρου search turn προστίθεται, με βάρος λ=0,5, η gated process advantage του συγκεκριμένου turn. Τα retrieval observations δημιουργούνται από το περιβάλλον και δεν συμμετέχουν στο policy loss. Το final-answer turn λαμβάνει μόνο την outcome advantage.
Η βελτιστοποίηση παραμένει η clipped surrogate objective του GRPO μαζί με KL regularization. Το LOTAPO δεν αλλάζει τον βασικό optimizer· αλλάζει το σήμα που αποδίδεται στα tokens των search turns πριν από την ενημέρωση της policy.
Υπάρχει πρόσθετο scoring, επειδή χρειάζονται το full context και ένα leave-one-turn context για κάθε έγκυρο turn. Η υλοποίηση περιορίζει το overhead βάζοντας όλα τα contexts στο ίδιο batch και επαναχρησιμοποιώντας το full-context score για τα turns της ίδιας trajectory.
Το πείραμα σε επτά datasets
Η βασική policy αρχικοποιήθηκε από το Qwen2.5-3B-Instruct. Η εκπαίδευση χρησιμοποίησε Natural Questions, TriviaQA, HotpotQA και 2WikiMultiHopQA, με 20.000 παραδείγματα από κάθε dataset και 80.000 συνολικά. Τα MuSiQue, Bamboogle και PopQA δεν χρησιμοποιήθηκαν στην εκπαίδευση και αξιολόγησαν out-of-domain μεταφορά.
Όλες οι συγκρινόμενες μέθοδοι χρησιμοποίησαν τοπικό corpus της αγγλικής Wikipedia του 2018, E5 dense retriever με FAISS, τρία passages ανά αναζήτηση και έως τρία search turns. Οι μέθοδοι reinforcement learning εκπαιδεύτηκαν για 200 optimization steps σε οκτώ NVIDIA A100, με global batch size 512 και πέντε rollouts ανά prompt.
Η κύρια test metric ήταν exact match, ενώ στην εκπαίδευση χρησιμοποιήθηκε answer-level F1. Η κοινή υποδομή βοηθά τη σύγκριση, επειδή corpus, retriever και search budget παραμένουν σταθερά. Δεν μετατρέπει όμως το αποτέλεσμα σε γενικό benchmark για παραγωγικό web search, μεγαλύτερα μοντέλα ή μακρύτερες trajectories.
Αποτελέσματα και ablations
Το πλήρες LOTAPO πέτυχε macro-average exact match 0,326 στα επτά datasets. Η ισχυρότερη outcome-reward baseline, Search-R1-instruct, είχε 0,263, ενώ η πιο κοντινή step-reward baseline, IGPO, είχε 0,273. Η διαφορά από το IGPO ήταν 0,053 σε απόλυτη τιμή ή 19,4% σχετική βελτίωση, σύμφωνα με τους συγγραφείς.
Τα τέσσερα βασικά μεγέθη της αξιολόγησης LOTAPO
Στοιχεία της εργασίας arXiv v2. Τα scores αφορούν το συγκεκριμένο experimental setup και το overhead το συγκεκριμένο hardware και batching.
0,326 EMmacro-average LOTAPO στα επτά datasetsΚαλύτερο αποτέλεσμα στον βασικό πίνακα
+0,053απόλυτη διαφορά από το IGPO0,326 έναντι 0,273
+19,4%σχετική βελτίωση έναντι IGPOΥπολογισμός των συγγραφέων
+3,7%χρόνος ανά training step έναντι Search-R1198 έναντι 191 δευτερολέπτων
Στα τρία out-of-domain datasets, ο μέσος όρος του LOTAPO ήταν 0,233 έναντι 0,177 του IGPO. Αυτό δείχνει μεταφορά της βελτίωσης στις τρεις συγκεκριμένες κατανομές, όχι απόδειξη καθολικής γενίκευσης.
Οι ablations διαχωρίζουν τις δύο συνιστώσες. Το IGPO χωρίς gating είχε μέσο EM 0,273 και με gating 0,282. Το backward LOTAPO χωρίς gating είχε 0,285, ενώ ο πλήρης συνδυασμός έφτασε 0,326. Η μεγαλύτερη βελτίωση εμφανίστηκε όταν συνδυάστηκαν αναδρομική απόδοση και sign-consistency gating.
Η εικόνα δεν ήταν απολύτως ομοιόμορφη. Στο HotpotQA, το LOTAPO χωρίς gating είχε ελαφρώς υψηλότερο αποτέλεσμα από την πλήρη έκδοση. Το gate λειτουργεί ως συνολικός μηχανισμός σταθεροποίησης, όχι ως εγγύηση ότι κάθε dataset θα βελτιωθεί.
Κόστος, περιορισμοί και όσα δεν αποδεικνύονται
Στη συγκεκριμένη υλοποίηση, ο μέσος χρόνος ανά training step ήταν 191 δευτερόλεπτα για Search-R1, 196 για IGPO και 198 για LOTAPO. Το LOTAPO πρόσθεσε 7 δευτερόλεπτα ή 3,7% έναντι Search-R1 και περίπου 2 δευτερόλεπτα έναντι IGPO. Αυτές είναι wall-clock μετρήσεις σε οκτώ A100 με συγκεκριμένο batching, όχι θεωρητική εγγύηση για άλλη υποδομή.
Αργά στην εκπαίδευση, το F1 του LOTAPO πλησίασε το 0,57, ενώ IGPO και Search-R1 κινήθηκαν περίπου στο 0,47–0,48. Οι validation καμπύλες έδειξαν καθαρότερα πλεονεκτήματα στα HotpotQA και 2Wiki, ενώ στο TriviaQA οι διαφορές ήταν μικρότερες. Οι ίδιοι οι συγγραφείς σημειώνουν ότι οι καμπύλες δεν αποκλείουν άλλους παράγοντες, όπως overfitting.
Το leave-one-turn score είναι counterfactual attribution εξαρτώμενο από το context και την τρέχουσα policy. Δεν αποτελεί τυπικά ταυτοποιημένο causal effect. Η αντικατάσταση με [DELETE] επίσης δεν μοντελοποιεί αλληλεπιδράσεις πολλών turns που αφαιρούνται ταυτόχρονα και το paper δεν απομονώνει ξεχωριστά την επίδραση του placeholder στη συνοχή του context.
Η μέθοδος χρειάζεται gold answers για να βαθμολογήσει την πιθανότητά τους. Αυτό την κάνει κατάλληλη για supervised ή ελεγχόμενα training environments, όχι άμεση λύση για κάθε ανοικτό production query όπου δεν υπάρχει γνωστή σωστή απάντηση. Τα πειράματα περιορίζονται επίσης σε μοντέλο 3B, local retrieval, corpus Wikipedia 2018 και έως τρία search turns.
Τι σημαίνει για επιχειρηματικούς AI agents
Η άμεση εφαρμογή της εργασίας είναι η εκπαίδευση search agents και όχι ένα plugin για CRM, e-shop ή marketing. Ωστόσο, δίνει μια καθαρή αρχή σχεδιασμού: ένας agent πρέπει να αξιολογείται και για τη διαδρομή που ακολούθησε, όχι μόνο για το τελικό κείμενο.
Σε έρευνα ανταγωνισμού, μια σωστή σύνοψη δεν αρκεί αν τα queries βασίστηκαν σε αδύναμες πηγές ή μπέρδεψαν οντότητες. Σε e-commerce support, ένας agent μπορεί να συνδυάζει πολιτική επιστροφών, χαρακτηριστικά προϊόντος και κατάσταση παραγγελίας. Η ομάδα χρειάζεται να γνωρίζει ποια κλήση ανέκτησε το κρίσιμο στοιχείο, ποια απλώς επανέλαβε πληροφορία και ποια προκάλεσε λάθος σύνθεση.
Σε ροές που συνδέουν ERP και επιχειρησιακά λογισμικά, η αφαίρεση μιας κλήσης API δεν ισοδυναμεί πάντα με την αντικατάσταση κειμένου. Μπορεί να αλλάζει τη δομή των διαθέσιμων δεδομένων ή να καθιστά αδύνατη μια επόμενη ενέργεια. Το counterfactual test πρέπει να παραμένει λειτουργικά έγκυρο και να καταγράφει τις εξαρτήσεις.
Η ανάγκη για replayable traces συνδέεται άμεσα με το ερώτημα ποιος ευθύνεται όταν ένας αυτοματισμός AI αποτυγχάνει. Αν το σύστημα κρατά μόνο την τελική απάντηση, η ομάδα δεν μπορεί να ξεχωρίσει αποτυχία retrieval, λάθος εργαλείο, κακή σύνθεση ή υπερβολικό permission.
Το production κριτήριο
Μια σωστή απάντηση δεν αρκεί όταν η διαδρομή δεν είναι επαναλήψιμη, ελεγχόμενη και οικονομικά βιώσιμη.
Το ελάχιστο audit χρειάζεται source provenance, tool-call logs, κόστος και latency ανά βήμα, σαφές success criterion, καταγραφή fallback και ιδιοκτήτη για κάθε ανθρώπινη έγκριση.
Σε customer support, τα πραγματικά KPIs πρέπει να συνδυάζουν επίλυση, ακρίβεια, κόστος, escalation και ποιότητα πηγών. Το παράδειγμα των AI agents στην εξυπηρέτηση πελατών δείχνει γιατί το λειτουργικό μοντέλο έχει την ίδια σημασία με το μοντέλο AI.
Έξι έλεγχοι για μια πραγματική ροή agent
Μια επιχείρηση δεν χρειάζεται να αντιγράψει τον ερευνητικό training loop για να εφαρμόσει το βασικό μάθημα. Χρειάζεται όμως ένα test set με γνωστές απαντήσεις και μια μέθοδο που ξεχωρίζει outcome quality από process quality.
Έξι έλεγχοι για search και tool-using agents
- Βήμα 1Ορίστε το σωστό αποτέλεσμα πριν από το test
Δημιουργήστε αντιπροσωπευτικά business scenarios με γνωστή απάντηση, επιτρεπόμενες πηγές και σαφή κριτήρια αποδοχής. Χωρίς gold set, δεν υπάρχει σταθερή βάση για counterfactual σύγκριση.
- Βήμα 2Καταγράψτε κάθε query, observation και tool call
Κρατήστε timestamp, πηγή, parameters, αποτέλεσμα, κόστος και latency. Το trace πρέπει να μπορεί να αναπαραχθεί χωρίς να αποθηκεύει αχρείαστα προσωπικά ή ευαίσθητα δεδομένα.
- Βήμα 3Διαχωρίστε outcome από process metrics
Μετρήστε ορθότητα τελικής απάντησης, αλλά και ποιότητα πηγών, περιττές κλήσεις, αποτυχημένα retrievals, unsupported claims και σωστή χρήση των παρατηρήσεων.
- Βήμα 4Δοκιμάστε ελεγχόμενες αφαιρέσεις
Αφαιρέστε ή αντικαταστήστε ένα βήμα χωρίς να αλλάξετε prompts, εργαλεία ή retrieval budget. Αν η επόμενη ενέργεια εξαρτάται δομικά από αυτό, σχεδιάστε valid stub αντί για αυθαίρετη διαγραφή.
- Βήμα 5Ελέγξτε νέα domains και εξαιρέσεις
Χρησιμοποιήστε σενάρια εκτός του συνηθισμένου workload, παλιές και νέες πηγές, αντικρουόμενα δεδομένα και failures εργαλείων. Η επίδοση στο training set δεν αρκεί για production readiness.
- Βήμα 6Συνδέστε confidence με ανθρώπινη εποπτεία
Ορίστε πότε ο agent απαντά, πότε ζητά επιβεβαίωση και πότε σταματά. Η πιθανότητα του μοντέλου δεν είναι απόλυτη αλήθεια, ιδιαίτερα όταν η ενέργεια επηρεάζει χρήματα, δικαιώματα ή πελάτες.
Το τελευταίο βήμα συμπληρώνει το πλαίσιο για confidence, context και ανθρώπινη εποπτεία στους AI agents. Το LOTAPO βελτιώνει ένα training signal· δεν καταργεί governance, source verification, permissions ή τον άνθρωπο που αναλαμβάνει μια υψηλού ρίσκου εξαίρεση.
Το πρακτικό συμπέρασμα
Το LOTAPO δείχνει ότι η αξία ενός search turn πρέπει να κρίνεται μέσα στη συνολική διαδρομή και όχι μόνο από ό,τι συνέβη αμέσως μετά. Με backward leave-one-turn attribution και sign-consistency gating, δημιουργεί process supervision από την ίδια την policy χωρίς πρόσθετο reward model ή εξωτερικό judge.
Τα αποτελέσματα είναι ισχυρά στο συγκεκριμένο πείραμα και οι ablations δείχνουν ότι αναδρομική απόδοση και gating λειτουργούν συμπληρωματικά. Παραμένουν όμως αποτελέσματα ενός 3B μοντέλου, ενός τοπικού retrieval setup και σύντομων trajectories με γνωστές απαντήσεις.
Για μια επιχείρηση, η σωστή μεταφορά της ιδέας είναι μετρημένη: κρατήστε replayable traces, αξιολογήστε outcome και process χωριστά, δοκιμάστε ελεγχόμενες αφαιρέσεις, μετρήστε κόστος στη δική σας υποδομή και διατηρήστε ανθρώπινα όρια στις ενέργειες υψηλού ρίσκου. Ένας αξιόπιστος agent δεν είναι μόνο αυτός που έφτασε στη σωστή απάντηση, αλλά αυτός του οποίου η διαδρομή μπορεί να εξηγηθεί, να ελεγχθεί και να βελτιωθεί.
Αυτοματισμοί επιχειρήσεων & AI από την TWO DOTS
Μετατρέψτε ένα AI agent pilot σε ελεγχόμενο workflow με μετρήσιμα βήματα, πηγές και ανθρώπινα checkpoints.
Η TWO DOTS χαρτογραφεί queries, tool calls, CRM, ERP, e-shop και support ροές, ορίζει test cases, logs, approvals και fallback, ώστε η τελική απάντηση και η διαδρομή που την παρήγαγε να αξιολογούνται με κοινά κριτήρια.
Често задавани въпроси
Τι είναι το LOTAPO;
Είναι μέθοδος self-generated process supervision για multi-turn search agents. Αφαιρεί αναδρομικά ένα search turn, μετρά τη μεταβολή στην πιθανότητα της γνωστής σωστής απάντησης και μετατρέπει τη διαφορά σε turn-level learning signal.
Γιατί το όνομα άλλαξε από LAPO σε LOTAPO;
Η πρώτη έκδοση της εργασίας χρησιμοποιούσε LAPO. Η τρέχουσα έκδοση arXiv v2 της 16ης Ιουλίου 2026 χρησιμοποιεί LOTAPO, από το Leave-One-Turn Attribution for Policy Optimization. Το άρθρο ακολουθεί την πιο πρόσφατη πρωτογενή πηγή.
Τι είναι το Answer-Likelihood Gain;
Είναι η διαφορά ανάμεσα στη μέση log-likelihood της gold answer με το πλήρες pre-answer context και με ένα συγκεκριμένο search turn αντικατεστημένο από [DELETE]. Θετική τιμή δείχνει θετική απόδοση του turn στο συγκεκριμένο context και policy.
Χρειάζεται εξωτερικό reward model ή LLM judge;
Όχι. Το process signal προκύπτει από την τρέχουσα policy και τη γνωστή σωστή απάντηση. Η μέθοδος διατηρεί επίσης την τελική outcome reward και ενσωματώνεται στο GRPO.
Γιατί χρειάζεται sign-consistency gating;
Επειδή η ομαδική κανονικοποίηση μπορεί να αλλάξει την κατεύθυνση ενός raw attribution. Το gate κρατά την πρόσθετη process advantage μόνο όταν το raw gain και το normalized signal συμφωνούν στο ίδιο μη μηδενικό πρόσημο.
Ποιο ήταν το βασικό αποτέλεσμα του LOTAPO;
Στο συγκεκριμένο setup, το LOTAPO πέτυχε macro-average exact match 0,326 σε επτά datasets, έναντι 0,273 για το IGPO και 0,263 για το Search-R1-instruct.
Πόσο επιπλέον training κόστος είχε;
Η μετρημένη υλοποίηση χρειάστηκε 198 δευτερόλεπτα ανά training step έναντι 191 για Search-R1, αύξηση 3,7%. Η τιμή αφορά οκτώ NVIDIA A100 και το συγκεκριμένο batching, επομένως χρειάζεται νέα μέτρηση σε άλλη υποδομή.
Μπορεί να εφαρμοστεί άμεσα σε εμπορικό AI agent;
Η εργασία περιγράφει training method, όχι έτοιμο production προϊόν. Η άμεση εφαρμογή απαιτεί gold answers, πλήρη trajectories και counterfactual scoring. Μια επιχείρηση μπορεί πάντως να υιοθετήσει το ευρύτερο πλαίσιο: process metrics, replayable traces, controlled ablations και ανθρώπινα action gates.