ExTS: πώς οι AI agents αξιοποιούν καλύτερα ένα περιορισμένο search budget

Το ExTS δείχνει πώς οι AI agents κατανέμουν περιορισμένο search budget ανάμεσα σε νέα branches και βαθύτερη βελτίωση, με ελέγχους κόστους και ποιότητας.

Απάντηση πρώτα: όταν ένα AI agent έχει μικρό search budget, δεν πρέπει να ανοίγει μηχανικά όλο και περισσότερα branches. Χρειάζεται να εκτιμά αν μια νέα διαδρομή αξίζει περισσότερο από τη βαθύτερη βελτίωση του καλύτερου candidate που έχει ήδη βρει.

Το ExTS δείχνει πώς οι AI agents κατανέμουν περιορισμένο search budget ανάμεσα σε νέα branches και βαθύτερη βελτίωση, με ελέγχους κόστους και ποιότητας.

Ένα agent μπορεί να ξοδέψει δεκάδες ακριβές αξιολογήσεις χωρίς να πλησιάσει ουσιαστικά καλύτερη λύση. Το πρόβλημα δεν είναι πάντα η ποιότητα του μοντέλου ή το συνολικό compute. Συχνά είναι ο τρόπος με τον οποίο μοιράζεται το διαθέσιμο budget ανάμεσα στην εξερεύνηση νέων επιλογών και στη βελτίωση μιας ήδη υποσχόμενης διαδρομής.

Η εργασία Exploit More, Explore Smarter for Budget-Constrained Agentic Search των Haoyang Fang και Bernie Wang προτείνει το ExTS, μια πολιτική tree search που κάνει τη δημιουργία νέου branch ξεχωριστή απόφαση αξίας πληροφορίας. Συνδυάζει discriminative reward shaping, stochastic virtual child και quality-conditioned branching, ώστε κάθε νέα αξιολόγηση να ανταγωνίζεται τις εναλλακτικές χρήσεις του ίδιου περιορισμένου budget.

Με μία σταθερή διαμόρφωση σε prompt optimization, code generation, molecular structure elucidation και agentic workflow optimization, οι συγγραφείς αναφέρουν μέσο σχετικό κέρδος 5,5% έναντι task-specific baselines. Το αποτέλεσμα αφορά τα συγκεκριμένα benchmarks, models και scorers· δεν αποτελεί υπόσχεση ίδιου ROI σε κάθε επιχειρησιακό AI workflow.

Περιεχόμενα

Γιατί το μικρό budget αλλάζει το search

Η μελέτη ορίζει ως budget-constrained agentic search την αναζήτηση όπου ένα LLM προτείνει και βελτιώνει candidates, ενώ τόσο η παραγωγή όσο και η επικύρωσή τους καταναλώνουν περιορισμένο αριθμό αξιολογήσεων. Οι candidates μπορεί να είναι prompts, κώδικας, operator graphs, σχέδια ενεργειών ή άλλες λύσεις για τις οποίες υπάρχει validator.

Στα κλασικά σχήματα Monte Carlo Tree Search, ο exploration bonus είναι χρήσιμος όταν το δέντρο μπορεί να δεχθεί πολύ μεγάλο αριθμό επισκέψεων. Όταν όμως υπάρχουν μόνο δεκάδες ή εκατοντάδες evaluations, το bonus μπορεί να κυριαρχήσει στις πρώτες επισκέψεις. Το αποτέλεσμα είναι ένα πλατύ και ρηχό δέντρο: ανοίγουν πολλά siblings πριν προλάβει να ωριμάσει η καλύτερη αλυσίδα βελτίωσης.

Γι’ αυτό η απλή αύξηση του exploration constant δεν λύνει όλο το πρόβλημα. Ένας scalar συντελεστής αλλάζει πόσο έντονα εξερευνά το σύστημα, αλλά δεν αποφασίζει αν ένας συγκεκριμένος node δικαιολογεί νέο branch ούτε διορθώνει από μόνος του τα flat rewards και τις επαναλαμβανόμενες αποτυχίες.

Η ίδια λογική εμφανίζεται όταν μια επιχείρηση μετρά το AI ROI στην αξία της πραγματικής εργασίας: περισσότερα tokens ή περισσότερες κλήσεις δεν ισοδυναμούν αυτομάτως με καλύτερο αποτέλεσμα.

Expansion ή deepening;

Η κεντρική ιδέα του ExTS είναι ότι το expansion πρέπει να ανταγωνίζεται το deepening. Σε κάθε εσωτερικό node, το σύστημα συγκρίνει τον καλύτερο πραγματικό child με έναν εικονικό child που αντιπροσωπεύει την αναμενόμενη αξία ενός νέου branch. Αν ο virtual child φαίνεται πιο χρήσιμος, το δέντρο διευρύνεται. Διαφορετικά, το search κατεβαίνει βαθύτερα στην πιο υποσχόμενη υπάρχουσα διαδρομή.

Μία μονάδα budget, τρεις επιλογές

Η επόμενη αξιολόγηση πρέπει να κερδίσει τη θέση της

Το ExTS ξεχωρίζει την ποιότητα του candidate από την αξία της επόμενης κίνησης στο συγκεκριμένο search tree.

Νέο branch

Δοκιμάζεται όταν το reward history δείχνει ότι μια νέα παραλλαγή μπορεί να προσφέρει περισσότερη πληροφορία από τους υπάρχοντες children.

Βαθύτερη βελτίωση

Προτιμάται όταν ένα υπάρχον branch έχει αρκετό exploitation signal και δικαιολογεί ακόμη έναν κύκλο refinement.

Περιορισμός branching

Ενεργοποιείται όταν ο node δεν περνά το quality gate ή έχει ήδη εξαντλήσει το επιτρεπόμενο πλάτος για τις επισκέψεις του.

Η διάκριση είναι ιδιαίτερα χρήσιμη σε iterative systems. Ένα agent που βελτιώνει κώδικα μπορεί να γράψει ακόμη μία διαφορετική λύση ή να διορθώσει εκείνη που ήδη περνά τα περισσότερα tests. Ένα agent για marketing copy μπορεί να ανοίξει νέο concept ή να βελτιώσει το ισχυρότερο concept με βάση συγκεκριμένο feedback. Και ένα workflow optimizer μπορεί να δοκιμάσει νέα operator graph ή να εξελίξει μία δομή που ήδη λειτουργεί.

Η σχετική ανάλυση για το branching στο recursive agentic reasoning δείχνει γιατί η δομή του search έχει δική της σημασία. Το ExTS εστιάζει ειδικά στο ποιος branch δικαιούται να καταναλώσει την επόμενη ακριβή αξιολόγηση.

Πώς ξεχωρίζουν τα χρήσιμα scores

Σε validation-heavy tasks, πολλά επιτυχημένα outputs παίρνουν κοντινές βαθμολογίες. Αν όλα μοιάζουν σχεδόν ισοδύναμα, το exploitation signal γίνεται αδύναμο και η επιλογή προσεγγίζει την τυχαιότητα. Το ExTS κανονικοποιεί τα observed scores και εφαρμόζει temperature-controlled μη γραμμικό μετασχηματισμό, ώστε οι υψηλότερες τιμές να διαχωρίζονται καθαρότερα.

Το shaped reward πολλαπλασιάζεται με success-rate weight. Ένα subtree που παράγει συχνά syntax errors, timeouts, invalid outputs ή domain-specific rejections υποβαθμίζεται, ακόμη κι αν μερικές σπάνιες επιτυχίες του έχουν υψηλό score. Ο εκθέτης α ρυθμίζει πόσο έντονα επηρεάζει την επιλογή αυτή η αποτυχία.

Αυτό δεν σημαίνει ότι η επιθετική ενίσχυση των καλύτερων scores είναι πάντα σωστή. Αν ο validator είναι αδύναμο proxy για τον πραγματικό στόχο, μπορεί να μεγαλοποιήσει μια μικρή αλλά παραπλανητική διαφορά. Στο LiveCodeBench, για παράδειγμα, λίγα public tests λειτουργούν ως proxy για το κρυφό test suite· η ηπιότερη θερμοκρασία βελτίωσε την pilot-adapted έκδοση.

Τι κάνει ο virtual child

Ο virtual child δεν παίρνει μια σταθερή αυθαίρετη αρχική αξία. Το ExTS υπολογίζει έναν fair-share αριθμό επισκέψεων από τους πραγματικούς children και δειγματοληπτεί με επανάθεση από το reward history του parent. Η εκτίμησή του προσαρμόζεται έτσι στην κλίμακα και στην κατανομή των scores του συγκεκριμένου search.

Όταν υπάρχουν λίγα δεδομένα, τα samples έχουν μεγαλύτερη διακύμανση και διατηρούν χώρο για exploration. Καθώς οι παρατηρήσεις αυξάνονται, ένας πραγματικός child με σταθερά καλό ιστορικό μπορεί να ξεπεράσει τον virtual child και να κατευθύνει το budget βαθύτερα. Η αβεβαιότητα δεν αντιμετωπίζεται ως λόγος για άπειρο branching, αλλά ως πληροφορία μέσα στην ίδια σύγκριση.

Οι συγγραφείς αντιπαραβάλλουν αυτή τη συμπεριφορά με το fixed first-play urgency. Μια σταθερή τιμή αλληλεπιδρά με το exploration constant, τη θερμοκρασία και την κλίμακα του task. Ο virtual child, αντίθετα, αντλεί το reference του από τις ανταμοιβές που έχει ήδη παρατηρήσει ο συγκεκριμένος parent.

Πώς λειτουργούν τα quality gates

Το ExTS χρησιμοποιεί δύο επίπεδα ελέγχου. Πρώτον, ένας non-root internal node μπορεί να δημιουργήσει επιπλέον child μόνο αν το score του περνά ένα προσαρμοζόμενο quantile threshold. Δεύτερον, η progressive widening εκδοχή αυξάνει το μέγιστο branching factor μόνο όταν ο node έχει αρκετές επισκέψεις και βρίσκεται αρκετά ψηλά στην κατανομή ποιότητας.

Κάθε leaf παίρνει τουλάχιστον μία ευκαιρία επέκτασης. Το gate εφαρμόζεται αφού υπάρχει αρχικό evidence, όχι πριν. Το root επίσης εξαιρείται από τον ποιοτικό αποκλεισμό, επειδή ένα κακό πρώτο sample θα μπορούσε διαφορετικά να στερήσει από όλο το δέντρο την αρχική ποικιλία.

Στα ablations του HotpotQA, η πλήρης μέθοδος έφτασε 64,89%. Χωρίς virtual child έπεσε στο 61,67%, χωρίς gated expansion στο 63,22%, χωρίς gated progressive widening στο 62,55% και με ασθενέστερη ποινή αποτυχίας στο 57,11%. Στο LiveCodeBench, η αφαίρεση του gated progressive widening κόστισε 1,3 ποσοστιαίες μονάδες στο συνολικό pass@1.

Τι έδειξαν τα benchmarks

Η κύρια αξιολόγηση καλύπτει τέσσερα domains με κοινό budget για τις συγκρινόμενες μεθόδους μέσα σε κάθε πείραμα. Στο prompt optimization, το ExTS ενσωματώθηκε στο GEPA/DSPy για HotpotQA και HoVeR. Στο code generation χρησιμοποιήθηκε στο TreeQuest για 182 προβλήματα LiveCodeBench με budget 128. Στο molecular structure elucidation εφαρμόστηκε στο K-MSE για 216 μόρια και 16 rollouts. Στο workflow optimization αξιολογήθηκε στο AFlow πάνω στο DROP με 20 rounds.

ExTS · fixed configuration

Τέσσερα αποτελέσματα από διαφορετικά search landscapes

Οι μετρικές δεν είναι άμεσα συγκρίσιμες μεταξύ τους και δεν πρέπει να αθροίζονται σε ένα universal score.

64,89%HotpotQA accuracy έναντι 58,55% για GEPA Pareto
46,2%συνολικό LiveCodeBench pass@1 και 19,1% στο hard split
91,0%K-MSE exact-match ACC έναντι 89,8% για το baseline
90,96 F1στο DROP με μέσο κόστος 15,26 δολάρια στο συγκεκριμένο setup

Στο HotpotQA, το ExTS είχε επίσης χαμηλότερη διακύμανση από το GEPA Pareto στα τρία seeds. Στο HoVeR η διαφορά της fixed έκδοσης ήταν μόλις 0,2% και εντός θορύβου. Στο hard split του LiveCodeBench έφτασε 19,1% pass@1 έναντι 18,1% για Standard MCTS και 17,1% για AB-MCTS-A. Στο K-MSE, το exact-match ACC ήταν 91,0% έναντι 89,8%.

Στο DROP, η fixed έκδοση είχε F1 90,96 και μέσο κόστος 15,26 δολάρια, έναντι F1 89,28 και 36,70 δολαρίων για τη linear CoT αλυσίδα, και F1 87,89 με 26,09 δολάρια για το AFlow. Η cost comparison αναφέρεται μόνο σε αυτό το domain, επειδή εκεί το conditioning depth μεταβάλλει το μήκος του context. Δεν είναι γενικός τιμοκατάλογος agentic AI.

Το επίσημο repository αναφέρει ότι η εργασία έγινε δεκτή στα Findings of EMNLP 2026 και διαθέτει dependency-free implementation του selector μαζί με integration examples. Αυτό ενισχύει την αναπαραγωγιμότητα, αλλά δεν αναιρεί την ανάγκη για δικά σας tests: ακόμη και το repository χαρακτηρίζει το μικρής κλίμακας integration result ενδεικτικό και συνιστά ανθρώπινο review.

Γιατί ένα setting δεν ταιριάζει παντού

Η μελέτη προτείνει τέσσερα pilot diagnostics: failure rate, normalized score deviation, score drift και refinement variance. Ο πρώτος δείχνει πόσες expansions αποτυγχάνουν. Ο δεύτερος αποτυπώνει πόσο απλωμένα είναι τα επιτυχημένα scores. Το score drift μετρά πόσο αλλάζουν τα όρια κανονικοποίησης καθώς εμφανίζονται νέα extremes. Η refinement variance δείχνει πόσο διαφορετικά αποτελέσματα παράγει ο stochastic refiner από το ίδιο input.

Οι υπογραφές οδηγούν σε συγκεκριμένες αλλά όχι καθολικές προσαρμογές. Υψηλό failure rate κάνει πιο κρίσιμο τον success exponent α. Υψηλό score drift ευνοεί ισχυρότερη πρώιμη εξερεύνηση και χαλάρωση του score gate. Χαμηλή variance ή weak validator μπορεί να απαιτήσει ηπιότερο reward shaping, ώστε το search να μη δεσμευτεί πρόωρα σε διαφορές που δεν προβλέπουν πραγματική βελτίωση.

Η fixed έκδοση δεν χρειάζεται pilot και ήδη ταίριαξε ή ξεπέρασε τα task-specialized baselines στα συγκεκριμένα tests. Οι περισσότερες pilot-adapted αλλαγές πρόσθεσαν 0,2 έως 1,2 ποσοστιαίες μονάδες. Οι συγγραφείς δηλώνουν επίσης ότι δεν έκαναν εξαντλητικό grid search, επειδή το κόστος των agentic πειραμάτων είναι υψηλό.

Τι σημαίνει για επιχειρησιακά AI workflows

Η ασφαλής επιχειρηματική ανάγνωση δεν είναι «αντικαταστήστε κάθε optimizer με ExTS». Είναι ότι κάθε iterative AI workflow χρειάζεται ρητή πολιτική κατανομής budget. Η ομάδα πρέπει να γνωρίζει τι θεωρεί candidate, τι μετρά ο validator, ποια failures καταναλώνουν budget και ποια συνθήκη δικαιολογεί νέο branch αντί για deepening.

Σε e-commerce, οι candidates μπορεί να είναι περιγραφές προϊόντων, ροές υποστήριξης ή rules για merchandising. Στο marketing μπορούν να είναι concepts, landing-page variants ή SEO briefs. Στην ανάπτυξη λογισμικού μπορούν να είναι patches που περνούν διαδοχικά tests. Το paper δεν δοκιμάζει όλες αυτές τις εφαρμογές, αλλά δίνει architecture pattern για συστήματα όπου η αξιολόγηση είναι ακριβή και επαναλαμβανόμενη.

Ένα production dashboard θα έπρεπε να παρακολουθεί success rate, score spread, drift, κόστος ανά valid candidate, depth του καλύτερου branch, βελτίωση ανά πρόσθετη αξιολόγηση και λόγο exploration προς exploitation. Οι μετρήσεις πρέπει να συνδέονται με outcome που έχει επιχειρηματικό νόημα, όχι μόνο με εύκολο heuristic score.

Αυτό συμπληρώνει τα controls που χρειάζονται τα AI agent harnesses για έλεγχο και κόστος, καθώς και τη λογική ότι τα AI employees πρέπει να λειτουργούν ως επαναλήψιμα συστήματα εργασίας και όχι ως μεμονωμένα prompts.

Production gate

Βελτιστοποιήστε το search μόνο αφού εμπιστεύεστε τον validator

Αν το score δεν προβλέπει το πραγματικό business outcome, ένα καλύτερο tree policy μπορεί απλώς να βρει γρηγορότερα τον λάθος στόχο. Πριν από κάθε rollout, απαιτούνται held-out tests, failure taxonomy, όριο κόστους και σαφές fallback.

Όρια, validators και ανθρώπινη εποπτεία

Τα πειράματα χρησιμοποίησαν ένα model ανά domain και διαφορετικά datasets, metrics και budgets. Δεν αξιολογήθηκε συστηματικά η μεταφορά των diagnostics ανάμεσα σε όλες τις model families. Το pilot tree καταναλώνει επίσης compute, ακόμη κι αν μεγάλο μέρος των μετρήσεων μπορεί να συλλεχθεί από ένα baseline run που η ομάδα θα εκτελούσε ούτως ή άλλως.

Ο validator είναι το πιο κρίσιμο όριο. Στο K-MSE, ο scorer βασίζεται σε embedding similarity και μπορεί να αποδώσει υψηλό reward σε δομικά παρόμοια αλλά λανθασμένα μόρια. Στο LiveCodeBench, λίγα public tests είναι ατελές proxy για το hidden suite. Σε μια επιχείρηση, αντίστοιχο λάθος μπορεί να εμφανιστεί όταν ένα readability score υποκαθιστά το brand fit, όταν ένα click metric υποκαθιστά το κέρδος ή όταν ένα automated check δεν καλύπτει compliance.

Η ανθρώπινη εποπτεία χρειάζεται στα σημεία όπου το score δεν συλλαμβάνει το ρίσκο. Ένα agent μπορεί να διατηρεί εξαιρετικό validation score και παρ’ όλα αυτά να παραβιάζει πολιτικές, να χρησιμοποιεί λάθος δεδομένα ή να βελτιστοποιεί ανεπιθύμητη συμπεριφορά. Η ανάλυση για AI agents με όρια και κλιμακούμενη αυτονομία εξηγεί γιατί η εξουσιοδότηση πρέπει να ακολουθεί την αποδεδειγμένη κρίση του συστήματος.

Το NIST AI RMF και το Generative AI Profile οργανώνουν αυτή την πρακτική γύρω από govern, map, measure και manage. Για ένα ExTS-like σύστημα, αυτό σημαίνει τεκμηρίωση του στόχου, ανεξάρτητη μέτρηση του validator, καταγραφή κάθε search decision και διαδικασία παρέμβασης όταν κόστος, drift ή failure rate περάσουν τα αποδεκτά όρια.

Επτά βήματα για ελεγχόμενο pilot

Ένα production pilot πρέπει να αποδείξει ότι η πολιτική budget allocation βελτιώνει το πραγματικό workflow και όχι μόνο ένα εσωτερικό benchmark.

Από τον candidate στον ελεγχόμενο search controller

  1. Βήμα 1Ορίστε το search object

    Καθορίστε αν ο candidate είναι prompt, κώδικας, workflow, περιεχόμενο ή action plan και ποια πεδία επιτρέπεται να αλλάζει ο refiner.

  2. Βήμα 2Κλειδώστε το συνολικό budget

    Μετρήστε model calls, validation runs, latency, ανθρώπινο χρόνο και οικονομικό κόστος σε κοινό πλαίσιο πριν αρχίσει το search.

  3. Βήμα 3Επικυρώστε τον validator

    Συγκρίνετε το score με held-out outcomes, policy checks και ανθρώπινη κρίση για να εντοπίσετε reward-metric gaps.

  4. Βήμα 4Καταγράψτε failures και drift

    Μετρήστε invalid outputs, timeouts, score spread, αλλαγές στα normalization bounds και stochastic variance του refiner.

  5. Βήμα 5Συγκρίνετε με απλά baselines

    Τρέξτε linear refinement, standard MCTS ή τον υπάρχοντα optimizer με ίδιο budget και ίδιες test περιπτώσεις.

  6. Βήμα 6Ελέγξτε tree shape και marginal gain

    Παρακολουθήστε πλάτος, βάθος, καλύτερο branch και βελτίωση ανά πρόσθετη αξιολόγηση, όχι μόνο το τελικό score.

  7. Βήμα 7Θέστε release gate και fallback

    Ορίστε πότε σταματά το search, πότε ζητείται ανθρώπινη έγκριση και πότε επιστρέφει η ασφαλής baseline διαδικασία.

Τα αποτυχημένα branches δεν είναι άχρηστα αν καταγράφονται σωστά. Μπορούν να βελτιώσουν failure taxonomies, validators και training data, όπως δείχνει και η ανάλυση για το πώς οι αποτυχημένες διαδρομές AI agent γίνονται καλύτερα δεδομένα.

Από το περισσότερο compute στο καλύτερο compute

Το ExTS μεταφέρει τη συζήτηση από το «πόσες φορές θα καλέσουμε το μοντέλο» στο «γιατί αξίζει η επόμενη κλήση». Το reward shaping ξεχωρίζει στενές διαφορές, ο virtual child εκτιμά την αξία ενός νέου branch και τα quality gates περιορίζουν την ανεξέλεγκτη διεύρυνση αδύναμων subtrees.

Η σημαντικότερη αρχή για μια επιχείρηση είναι ότι exploration και exploitation είναι αποφάσεις κόστους με μετρήσιμο ρίσκο. Όταν validation, latency, ανθρώπινη εποπτεία και model calls έχουν πραγματική τιμή, ο agent χρειάζεται κανόνες για το πού συνεχίζει, πού διακλαδίζεται και πότε σταματά.

Η μέθοδος προσφέρει μια τεκμηριωμένη βάση για αυτή την κατανομή, όχι καθολική συνταγή. Το αποτέλεσμα αξίζει μόνο όταν ο validator αντιστοιχεί στον πραγματικό στόχο, το budget είναι ορατό, οι αποτυχίες καταγράφονται και η ομάδα μπορεί να επιστρέψει σε ασφαλές fallback.

AI workflows με μετρήσιμο budget

Δώστε σε κάθε agent σαφή στόχο, validator και όριο κόστους

Η TWO DOTS χαρτογραφεί candidates, model calls, validations, approvals, monitoring και fallback ώστε ένα agentic workflow να επενδύει compute εκεί όπου παράγει ελεγχόμενη επιχειρηματική αξία.

Συχνές ερωτήσεις

Τι είναι το ExTS;

Είναι πολιτική tree search για budget-constrained AI agents. Συνδυάζει reward shaping, stochastic virtual child και quality-conditioned branching για να επιλέγει ανάμεσα σε νέο branch και βαθύτερο refinement.

Ποιο πρόβλημα προσπαθεί να λύσει;

Περιορίζει τη σπατάλη μικρού evaluation budget σε πλατιά, ρηχά search trees και σε branches που δεν έχουν δείξει αρκετή ποιότητα ή παραγωγικότητα.

Τι είναι ο virtual child;

Είναι στοχαστική εκτίμηση της αξίας ενός νέου branch, βασισμένη στο reward history του parent. Αν ξεπεράσει τον καλύτερο πραγματικό child, το σύστημα επιλέγει expansion.

Γιατί δεν αρκεί η αλλαγή του exploration constant;

Επειδή ένας scalar συντελεστής δεν διορθώνει ταυτόχρονα τα flat rewards, την υποχρεωτική επέκταση αδύναμων siblings και το branching χωρίς quality gate.

Σε ποια domains αξιολογήθηκε;

Στην κύρια αξιολόγηση χρησιμοποιήθηκαν prompt optimization, code generation, molecular structure elucidation και agentic workflow optimization. Υπάρχει επίσης πρόσθετο πείραμα GPU kernel optimization.

Ποιο ήταν το συνοπτικό αποτέλεσμα;

Οι συγγραφείς αναφέρουν μέσο σχετικό κέρδος 5,5% με μία fixed διαμόρφωση στα κύρια domains, αλλά οι επιμέρους μετρικές, models και budgets διαφέρουν.

Χρειάζεται πάντα pilot run;

Όχι. Η fixed διαμόρφωση λειτουργεί χωρίς pilot. Τα diagnostics βοηθούν σε μικρές task-specific προσαρμογές, αλλά χρειάζονται πρόσθετη μέτρηση και δεν εγγυώνται βέλτιστο tuning.

Τι πρέπει να ελέγξει μια επιχείρηση πριν από production χρήση;

Πρέπει να επαληθεύσει ότι ο validator προβλέπει το πραγματικό outcome, να ορίσει συνολικό budget, failure taxonomy, held-out tests, ανθρώπινη έγκριση και ασφαλές fallback.

Ενημερωτικό Δελτίο

Εισάγετε τη διεύθυνση email σας παρακάτω για να εγγραφείτε στο ενημερωτικό δελτίο μας