С повече от 20 години опит ние променяме вашето цифрово присъствие. Специализирани сме в разработването на уебсайтове и електронни магазини, SEO и цифров маркетинг, ERP софтуер и интелигентна автоматизация, които извеждат бизнеса ви на следващото ниво.
Το Recursive Agentic Reasoning δείχνει ότι το branching χρειάζεται paired evals πριν γίνει πολιτική παραγωγής.
Отговор първо: Στη μελέτη Recursive Agentic Reasoning, το Branch — πέντε ανεξάρτητες προσπάθειες και plurality vote — έδωσε το πιο σταθερό κέρδος ακρίβειας. Το αποτέλεσμα όμως δεν σημαίνει ότι κάθε AI agent χρειάζεται πέντε κλήσεις: μεγάλο μέρος του οφέλους συνδέθηκε με την ανάκτηση απαντήσεων που χάνονταν όταν το token budget τελείωνε πριν εμφανιστεί τελικό output.
Το Recursive Agentic Reasoning συγκρίνει Grow, Prune και Branch. Τι έδειξαν τα paired evals για ακρίβεια, κόστος, truncation και AI agents στην πράξη.
Αν ένα σύστημα AI έχει περισσότερο χρόνο και περισσότερες model calls, μπορεί να βελτιώσει ξανά την ίδια απάντηση, να διασπάσει το πρόβλημα σε υπο-ερωτήματα ή να δοκιμάσει ανεξάρτητες διαδρομές και να επιλέξει την επικρατέστερη. Οι ερευνητές έβαλαν αυτές τις επιλογές στο ίδιο πειραματικό πλαίσιο, με κοινά prompts, token budgets, answer extraction και grading code.
Στα 14 διαθέσιμα model–benchmark settings, με 49.327 βαθμολογημένα items και 151.876 model calls, το Branch βελτίωσε την ακρίβεια και στα 14 κατά μέσο όρο 5,98 ποσοστιαίες μονάδες. Η προσεκτική ανάγνωση δεν οδηγεί στο σύνθημα «πάντα κάνε πέντε samples». Οδηγεί σε καλύτερη παρατηρησιμότητα, paired αξιολόγηση και σαφή διάκριση ανάμεσα σε model error και infrastructure error.
Τρία σχήματα recursion πάνω στο ίδιο reasoning trace
Η εργασία παρουσιάζει τα test-time reasoning methods ως operators πάνω στη διαδρομή συλλογισμού ενός agent. Το Grow βαθαίνει μία διαδρομή: δίνει την προηγούμενη προσπάθεια ξανά στο μοντέλο, μέχρι δύο διαδοχικοί γύροι να καταλήξουν στην ίδια κανονικοποιημένη απάντηση ή να συμπληρωθούν τρεις γύροι. Είναι λιτή iterative refinement χωρίς ξεχωριστό critic.
Сайтът Prune μειώνει την πολυπλοκότητα μέσω decomposition. Το μοντέλο παράγει διαδοχικά υπο-ερωτήματα, λύνει το καθένα έχοντας στο context τις προηγούμενες απαντήσεις και στο τέλος συνθέτει τη συνολική απάντηση. Αν προτείνει μόνο ένα υπο-ερώτημα, επιστρέφει σε άμεση επίλυση ώστε να μην πληρωθεί άσκοπο overhead.
Сайтът Branch ανοίγει πέντε ανεξάρτητες διαδρομές με temperature 0,7 και επιλέγει απάντηση με plurality vote μετά από normalization. Τα κενά outputs παίρνουν ειδικό null key και δεν μπορούν να κερδίσουν, εκτός αν είναι κενά και τα πέντε samples. Οι συγγραφείς το ταυτίζουν αλγοριθμικά με self-consistency· το όνομα Branch εξυπηρετεί τη συμμετρία της σύγκρισης, όχι ισχυρισμό νέου αλγορίθμου.
Grow
Εμβαθύνει μία λύση και σταματά όταν δύο διαδοχικές κανονικοποιημένες απαντήσεις συμφωνήσουν ή ολοκληρωθούν τρεις γύροι.
Μία διαδρομήΈως 3 γύροι
Prune
Διασπά το πρόβλημα σε εξαρτώμενα υπο-ερωτήματα, λύνει τη σειρά και ανασυνθέτει μία τελική απάντηση.
DecompositionRecomposition
Branch
Παράγει πέντε ανεξάρτητες πλήρεις λύσεις και επιλέγει την επικρατέστερη κανονικοποιημένη απάντηση.
5 samplesPlurality vote
Γιατί η κοινή πειραματική βάση αλλάζει τη σύγκριση
Grow, Prune και Branch έχουν μελετηθεί σε διαφορετικές εργασίες, με διαφορετικά μοντέλα, graders και budgets. Έτσι, ένας υπεύθυνος AI προϊόντος δεν μπορεί να συγκρίνει αξιόπιστα gains που προέρχονται από ανόμοια setups. Η νέα εργασία κρατά σταθερό το solving primitive, το prompt, το token budget, το answer extraction και το grading, ώστε η διαφορά να αποδίδεται όσο γίνεται στο σχήμα της recursion.
Η βάση σύγκρισης είναι single-pass chain-of-thought. Τα benchmarks καλύπτουν multi-hop σύνθεση στο MuSiQue, expert-level ερωτήσεις στο HLE, δύσκολο general reasoning στο BBEH, graduate knowledge στο SuperGPQA και olympiad mathematics στο Omni-MATH. Τα τρία text-only reasoning endpoints ήταν DeepSeek-V4-Pro, MiniMax-M3 και Qwen3.6-plus. Το Omni-MATH δεν εκτελέστηκε στο Qwen, γι’ αυτό υπάρχουν 14 και όχι 15 cells.
Η επιλογή benchmarks έγινε με βάση το διαθέσιμο headroom: σύνολα όπου ένα ισχυρό μοντέλο βρισκόταν ήδη κοντά στο ταβάνι απορρίφθηκαν. Είναι πρακτική υπενθύμιση για εταιρικά evals. Αν το test suite είναι υπερβολικά εύκολο, δεν μπορεί να αποκαλύψει διαφορά ανάμεσα σε orchestration strategies. Το ίδιο πρόβλημα εξετάζει και η ανάλυσή μας για το πώς το benchmark harness μπορεί να αλλάξει τον νικητή.
Το Branch ήταν θετικό και στα 14 settings
Με paired scoring, το Branch κέρδισε κατά μέσο όρο 5,98 μονάδες, με median 6,47 και εύρος από 0,66 έως 13,50. Ήταν αυστηρά πρώτο σε 12 cells, ισοφάρισε στην πρώτη θέση σε ένα και έχασε σε ένα. Το Grow είχε μέση βελτίωση 2,18 μονάδες και ήταν θετικό σε 11 από 14 cells, αλλά υποχώρησε κατά 1,25 μονάδες στο DeepSeek–MuSiQue και κατά 2,50 στο DeepSeek–BBEH.
Το Prune βελτίωσε τον μέσο όρο μόλις κατά 0,94 μονάδες, με εύρος από −2,17 έως +4,00. Οι συγγραφείς σημειώνουν ότι στα μικρότερα cells ένα μέρος των διαφορών δύσκολα ξεχωρίζει από τον θόρυβο. Δεν αναφέρουν significance tests, ενώ σε cell 200 items ένα απλό 95% διάστημα γύρω από μία accuracy τιμή είναι περίπου ±7 μονάδες.
Η εικόνα δεν υποστήριξε την αρχική routing hypothesis, δηλαδή ότι διαφορετικά προβλήματα χρειάζονται διαφορετικό operator. Το Branch ήταν πρώτο και στα πέντε cells του DeepSeek και στα πέντε του MiniMax. Στα τέσσερα Qwen cells η εικόνα μοιράστηκε, μαζί με μία ισοπαλία. Με αυτά τα δεδομένα, ένας router θα μάθαινε σχεδόν σταθερή πολιτική αντί για ουσιαστική επιλογή ανά task.
Το εύρος της δοκιμής
Τα τέσσερα μεγέθη που στηρίζουν το κύριο συμπέρασμα
Οι αριθμοί αφορούν το συγκεκριμένο κοινό harness και δεν αποτελούν γενικό SLA για παραγωγικά AI agents.
14/14Cells όπου το Branch ξεπέρασε το single-pass baseline
+5,98 μονάδεςΜέση βελτίωση accuracy του Branch
49.327 itemsΣυνολικά βαθμολογημένα records
151.876 callsΚλήσεις μοντέλων σε όλη την αξιολόγηση
Το απρόσμενο εύρημα ήταν τα κενά outputs
Η συνηθισμένη εξήγηση για το self-consistency είναι ότι διαφορετικές reasoning paths οδηγούν σε κοινή σωστή απάντηση. Η μελέτη δεν απορρίπτει αυτή την εξήγηση, αλλά εντοπίζει και δεύτερο μηχανισμό: πολλά single-pass calls εξαντλούν το budget μέσα στο hidden deliberation stream και επιστρέφουν επιτυχώς σε επίπεδο API, αλλά χωρίς user-visible απάντηση.
Στο HLE με DeepSeek-V4-Pro, το baseline έδωσε κενό output στο 51,2% των items. Τα αντίστοιχα ποσοστά ήταν 34,5% στο BBEH και 36,1% στο Omni-MATH. Με πέντε samples, το Branch μειώνει την πιθανότητα να μείνουν όλες οι προσπάθειες χωρίς απάντηση, ενώ το vote απορρίπτει δομικά τα null outputs. Στο HLE–DeepSeek το empty rate έπεσε από 51,2% σε 32,2%, και στο BBEH–MiniMax από 35,0% σε 15,5%.
Σε επίπεδο cell, το κέρδος του Branch συσχετίστηκε με το baseline empty-output rate με r=0,72 σε 14 παρατηρήσεις. Πρόκειται για συσχέτιση, όχι για απόδειξη μοναδικής αιτίας. Η αρνητική περίπτωση ενισχύει την ερμηνεία: το Qwen3.6-plus δεν παρήγαγε κενό output σε κανένα benchmark, και εκεί εμφανίστηκαν τα μικρότερα Branch gains και η μοναδική καθαρή ήττα του από το Grow.
Μια φθηνότερη παρέμβαση πριν από τα πέντε samples
Το κοινό solving primitive της εργασίας εντοπίζει όταν ένα reasoning model σταματά λόγω length με κενό content. Τότε δίνει ξανά στο μοντέλο το truncated reasoning και του ζητά να δεσμευτεί σε τελική απάντηση. Οι συγγραφείς θεωρούν ότι μέρος του οφέλους του Branch μπορεί να επιτευχθεί οικονομικότερα με αυτή τη στοχευμένη finalization pass.
Για production ομάδες, αυτή είναι η πιο πρακτική ιδέα της μελέτης. Πριν αυξηθεί οριζόντια το sample count, πρέπει να μετρηθούν stop reasons, empty content και exhaustion ανά task type. Αν το failure mode είναι κυρίως «σκέφτηκε μέχρι να τελειώσει το budget χωρίς να απαντήσει», μια ειδική recovery διαδρομή μπορεί να είναι προτιμότερη από πέντε πλήρεις λύσεις για κάθε request.
Αυτό είναι επιχειρηματική ερμηνεία και όχι άμεσο benchmark της εργασίας. Χρειάζεται A/B test με ίδιες εισόδους, κόστος, latency και grader. Το paper δεν αποδεικνύει ότι η finalization pass θα αντικαταστήσει το sampling σε customer support, content operations ή e-commerce automation. Δείχνει ποιο failure mode πρέπει να απομονωθεί. Για παρόμοια διάκριση ανάμεσα σε μοντέλο και σύστημα, δείτε γιατί τα terminal agents είναι ολόκληρο σύστημα και όχι μόνο μοντέλο.
Accuracy και efficiency δεν έδωσαν τον ίδιο νικητή
Το baseline χρειάζεται μία κλήση ανά item. Το Grow χρησιμοποίησε κατά μέσο όρο 2,23 calls, το Prune 4,04 και το Branch 4,85. Αν το gain διαιρεθεί με τις επιπλέον κλήσεις, το Grow απέδωσε +1,77 μονάδες ανά πρόσθετο call, το Branch +1,55 και το Prune +0,31. Άρα το Branch πέτυχε το υψηλότερο accuracy ceiling, όχι την καλύτερη αποδοτικότητα ανά κλήση.
Το σταθερό N=5 δεν είχε early stopping. Επειδή η μέθοδος ήδη υπολογίζει agreement, θα μπορούσε να σταματά όταν η πλειοψηφία έχει κριθεί μαθηματικά. Η εργασία δεν υλοποίησε αυτή τη βελτιστοποίηση, αλλά τη χαρακτηρίζει πρώτο λογικό επόμενο βήμα. Για πραγματικό προϊόν, παρόμοιος κανόνας μπορεί να μειώσει κόστος και latency χωρίς να αλλάξει το αποτέλεσμα του vote.
Το Prune ήταν dominated και στους δύο άξονες της συγκεκριμένης δοκιμής. Αυτό δεν σημαίνει ότι κάθε decomposition είναι άχρηστο. Σημαίνει ότι αυτή η λιτή υλοποίηση, στα συγκεκριμένα models, tasks και budgets, δεν έδωσε ανταγωνιστική σχέση accuracy–calls. Η γενίκευση σε workflows με εργαλεία, state ή φυσικές αλληλεξαρτήσεις απαιτεί νέο eval.
Κανόνας επιλογής
Μην αγοράζετε accuracy χωρίς να μετράτε την αιτία και το κόστος της
Συγκρίνετε single pass, targeted finalization, Grow και Branch πάνω στα ίδια resolved items. Καταγράψτε accuracy, empty-output rate, transport failures, calls, token cost, latency percentiles και agreement πριν ορίσετε production policy.
Το paired scoring απέτρεψε λάθος συμπέρασμα
Σε μεγάλες εκτελέσεις, διαφορετικοί operators μπορεί να αποτύχουν σε διαφορετικά items λόγω timeouts, resets ή rate limits. Αν κάθε μέθοδος βαθμολογηθεί πάνω σε ό,τι κατάφερε να ολοκληρώσει, τότε συγκρίνονται διαφορετικά σύνολα προβλημάτων. Οι συγγραφείς κράτησαν ανά cell μόνο τα items που επιλύθηκαν από όλες τις μεθόδους.
Συνολικά υπήρξαν 709 unrecoverable transport failures μετά από επτά retries με exponential backoff. Τα failures εξαιρέθηκαν αντί να βαθμολογηθούν ως λάθος μοντέλου. Έγινε επίσης deduplication ανά item, με προτίμηση στο επιτυχημένο record όταν υπήρχαν επαναλήψεις. Σε ένα αρχείο, η αφελής accuracy ανά γραμμή ήταν 36,3%, ενώ μετά το deduplication έγινε 72,5%.
Το αποκαλυπτικό παράδειγμα ήταν το Qwen–HLE. Αρχική unpaired ανάλυση έδειχνε πτώση του Branch από 14,20% σε 11,20%. Όμως το Branch είχε χάσει 172 από τα 500 items σε read timeouts, έναντι 131 του baseline. Στα 305 κοινά ολοκληρωμένα items, το Branch ήταν τελικά +0,66 μονάδες. Το artefact ήταν περίπου 3,6 μονάδες, μεγαλύτερο από αρκετά αληθινά effects του πίνακα.
Το μάθημα συνδέεται άμεσα με το AI ROI ανά πραγματική εργασία: ένα metric είναι χρήσιμο μόνο όταν το denominator, τα failures και η επιχειρησιακή μονάδα έχουν οριστεί καθαρά.
Τι πρέπει να καταγράφει ένα production AI evaluation
Ένα αξιόπιστο eval χρειάζεται σταθερό item ID, prompt και version, model και decoding settings, operator, token budget, stop reason, retries, transport status, extracted answer, grader result, latency και αριθμό calls. Η accuracy δεν πρέπει να συγχωνεύει κενές απαντήσεις, parsing errors, provider timeouts και κανονικά λανθασμένες λύσεις σε μία κατηγορία.
Για paired σύγκριση, η ομάδα πρέπει να ορίζει εκ των προτέρων τι γίνεται όταν ένας operator δεν ολοκληρώνει ένα item. Η διασταύρωση κοινών resolved items δίνει καθαρότερη σύγκριση, αλλά το attrition πρέπει να δημοσιεύεται επειδή αποτελεί operational signal. Στη μελέτη, έξι από τα 14 cells δεν είχαν attrition, ενώ το Qwen–HLE ήταν outlier με 195 χαμένα items από 500.
Χρειάζεται επίσης cost dashboard ανά operator. Η ίδια τελική accuracy μπορεί να προέρχεται από διαφορετικό πλήθος calls, άλλη κατανομή latency και διαφορετικό recovery behavior. Για e-commerce ή marketing automation, κατάλληλο metric μπορεί να είναι το κόστος ανά αποδεκτή και πλήρη απόφαση, όχι απλώς accuracy ανά request. Οι ίδιοι έλεγχοι είναι κεντρικοί όταν ένα AI agent harness περνά από δοκιμή σε σταθερή λειτουργία.
Από το paper σε ασφαλές production pilot
Стъпка 1Ορίστε το κοινό paired item set
Χρησιμοποιήστε αντιπροσωπευτικά requests της δικής σας ροής και σταθερά item IDs, ώστε κάθε operator να αξιολογείται πάνω στα ίδια προβλήματα.
Стъпка 2Κλειδώστε το single-pass baseline
Καταγράψτε model revision, prompt version, token budget, decoding settings, extractor και grader πριν αλλάξετε το orchestration.
Το Branch χρησιμοποιεί unweighted majority vote, όχι verifier ή confidence-weighted selection. Είναι flat sampling και όχι Tree of Thoughts ή Graph of Thoughts που επεκτείνουν και κλαδεύουν ενδιάμεσες καταστάσεις. Το agreement ratio καταγράφηκε αλλά δεν αξιοποιήθηκε ως βάρος ή confidence signal.
Η μελέτη δεν αναφέρει significance tests. Ο HLE grader είναι συντηρητικός lower bound σε σχέση με τον επίσημο LLM judge, το Omni-MATH δεν εκτελέστηκε στο Qwen και όλα τα μοντέλα είχαν hidden deliberation. Επομένως ο μηχανισμός truncation μπορεί να μη μεταφέρεται σε μοντέλα χωρίς αυτή τη συμπεριφορά.
Το pilot των 50 items είχε αρχικά υποστηρίξει το routing story: Grow +4, Prune +5,3 στο MuSiQue αλλά −2 στο HLE, και Branch +8. Στην πλήρη κλίμακα οι διαφορές περίπου υποδιπλασιάστηκαν και το sign flip του Prune εξαφανίστηκε. Με standard error κοντά στις 7 μονάδες για n=50, το pilot ήταν πολύ μικρό για το συμπέρασμα που φαινόταν να προσφέρει.
Υπάρχει και όριο μεταφοράς από benchmarks σε εργαλειοκεντρικούς agents. Η εργασία αξιολογεί text-only reasoning endpoints, όχι πολύβημα workflows με permissions, εξωτερικές καταστάσεις και μη αναστρέψιμες ενέργειες. Σε τέτοια περιβάλλοντα, οι αποτυχημένες διαδρομές μπορούν να αξιοποιηθούν ως δεδομένα, όπως δείχνει το PROOF-Gen, αλλά χρειάζονται πρόσθετα safety gates.
Μια πρακτική αρχιτεκτονική απόφασης για AI agents
Η μελέτη υποστηρίζει μια διαδοχική λογική. Πρώτα εκτελείται μία οικονομική λύση και ελέγχεται αν υπάρχει έγκυρη τελική απάντηση. Αν το call σταμάτησε λόγω length χωρίς content, ενεργοποιείται targeted finalization. Αν η απόφαση παραμένει αβέβαιη ή έχει υψηλό business impact, χρησιμοποιούνται ανεξάρτητα samples και σαφής selector. Η ακριβής πολιτική πρέπει να προκύψει από paired δεδομένα της εφαρμογής.
Σε content workflows αυτό μπορεί να σημαίνει διαφορετικές διαδρομές για factual extraction και editorial synthesis. Σε customer service, άλλη πολιτική για ένα συνηθισμένο status request και άλλη για επιστροφή με σύνθετους όρους. Σε e-commerce, το branching μπορεί να επιφυλάσσεται για ασυμφωνίες μεταξύ inventory, policy και order state. Αυτά είναι παραδείγματα εφαρμογής της μεθοδολογίας, όχι claims του paper.
Το κρίσιμο είναι να μη χρησιμοποιείται ο αριθμός samples ως υποκατάστατο της διάγνωσης. Αν πέντε calls κερδίζουν επειδή τέσσερα αποτυγχάνουν σιωπηλά, το προϊόν έχει πρόβλημα observability και budget handling. Αν κερδίζουν επειδή διαφορετικές έγκυρες λύσεις συγκλίνουν, τότε το selection mechanism είναι το βασικό asset. Παρόμοια προσοχή χρειάζεται όταν το ίδιο πρόβλημα αλλάζει την κρίση του AI ανάλογα με το prompt.
Η ουσία για ομάδες που χτίζουν AI systems
Сайтът Recursive Agentic Reasoning δεν ανακαλύπτει νέο search algorithm. Η αξία του βρίσκεται στην ελεγχόμενη σύγκριση και στην αποκάλυψη δύο confounders: truncation που μοιάζει με model failure και unpaired scoring που μπορεί να αντιστρέψει το συμπέρασμα. Το Branch ήταν το πιο σταθερό εργαλείο για υψηλότερη ακρίβεια, ενώ το Grow ήταν ελαφρώς καλύτερο σε gain ανά πρόσθετο call.
Για μια επιχείρηση, η σωστή ερώτηση δεν είναι «ποιος operator κέρδισε γενικά;». Είναι «ποιο failure mode έχουμε, σε ποια tasks, με τι κόστος και με ποιον τρόπο το μετρήσαμε;». Όταν η αξιολόγηση κρατά σταθερά τα items, ξεχωρίζει το infrastructure από το model behavior και δημοσιεύει attrition, τότε το test-time compute μετατρέπεται από εντυπωσιακό demo σε διαχειρίσιμη τεχνική απόφαση. Αυτό είναι και η βάση για να γίνουν οι AI ροές επαναλήψιμα συστήματα εργασίας.
AI orchestration με μετρήσιμα όρια
Σχεδιάστε reasoning workflows που ξέρουν πότε να δοκιμάζουν ξανά
Η TWO DOTS συνδέει AI αυτοματισμούς με paired evals, stop-reason telemetry, στοχευμένα fallbacks και human review, ώστε το branching να ενεργοποιείται εκεί όπου προσθέτει πραγματική αξία.
Είναι ένα κοινό πλαίσιο αξιολόγησης που συγκρίνει iterative refinement, decomposition και repeated sampling ως operators πάνω στη reasoning trace ενός AI agent.
Ποια μέθοδος απέδωσε καλύτερα;
Το Branch βελτίωσε την accuracy και στα 14 model–benchmark cells, κατά μέσο όρο 5,98 ποσοστιαίες μονάδες, και ήταν αυστηρά πρώτο σε 12.
Γιατί βοήθησε το Branch;
Εκτός από την ψήφο ανάμεσα σε διαφορετικές reasoning paths, ανέκτησε περιπτώσεις όπου ένα single pass εξάντλησε το token budget και δεν έδωσε τελική απάντηση.
Είναι το Branch το πιο αποδοτικό ανά call;
Όχι. Είχε το υψηλότερο accuracy ceiling, αλλά το Grow έδωσε μεγαλύτερο μέσο gain ανά πρόσθετη κλήση: +1,77 έναντι +1,55 μονάδων.
Τι σημαίνει paired scoring;
Σημαίνει ότι όλες οι μέθοδοι συγκρίνονται στα ίδια items που ολοκλήρωσαν όλες, ώστε διαφορετικά timeouts ή transport failures να μην αλλάζουν τη δυσκολία του δείγματος.
Γιατί τα infrastructure failures δεν βαθμολογούνται ως λάθος;
Επειδή έτσι τιμωρούνται περισσότερο οι μέθοδοι με περισσότερες κλήσεις και συγχέεται η αξιοπιστία του provider ή του harness με την ικανότητα του μοντέλου.
Πρέπει κάθε AI agent να χρησιμοποιεί πέντε samples;
Όχι. Το N=5 ήταν η ρύθμιση της μελέτης. Μια production ομάδα πρέπει πρώτα να μετρήσει truncation, κόστος, latency και την αξία targeted finalization ή early stopping.
Ποιος είναι ο βασικός περιορισμός της μελέτης;
Μεταξύ άλλων, το Branch είχε απλό unweighted vote, δεν αναφέρθηκαν significance tests και όλα τα μοντέλα ήταν reasoning models με hidden deliberation.