MARS: όταν οι εξειδικευμένοι AI agents παραδίδουν ο ένας στον άλλο τον ίδιο κώδικα

Το MARS συντονίζει εξειδικευμένους AI agents πάνω στον ίδιο κώδικα. Τι έδειξε στο CodeContests και ποια όρια χρειάζεται μια επιχειρησιακή εφαρμογή.

Answer first: το MARS δείχνει ότι μια μικρή ομάδα εξειδικευμένων AI agents μπορεί να βελτιώνει διαδοχικά τον ίδιο κώδικα, όταν η ανάθεση βασίζεται στο αλγοριθμικό θέμα και κάθε αλλαγή συναντά άμεσα execution feedback. Το αποτέλεσμα είναι ισχυρό στο συγκεκριμένο CodeContests benchmark, αλλά δεν αποδεικνύει ακόμη ότι το ίδιο relay μεταφέρεται αυτούσιο σε production repositories.

Το MARS συντονίζει εξειδικευμένους AI agents πάνω στον ίδιο κώδικα. Τι έδειξε στο CodeContests και ποια όρια χρειάζεται μια επιχειρησιακή εφαρμογή.

Τι αλλάζει όταν, αντί να ζητήσεις από ένα γενικό AI να σχεδιάσει, να γράψει και να διορθώσει κώδικα, βάζεις μια μικρή ομάδα ειδικών να δουλέψει διαδοχικά πάνω στην ίδια λύση; Η μελέτη MARS προτείνει ακριβώς αυτή τη μετατόπιση. Δεν μοιράζει τη δουλειά σε γενικούς ρόλους τύπου planner, coder και debugger. Επιλέγει agents με εξειδίκευση σε συγκεκριμένα αλγοριθμικά πεδία, τους δίνει σχετική θεωρία μέσω RAG και τους αφήνει να παραδίδουν ο ένας στον άλλο ένα κοινό πρόγραμμα.

Το αποτέλεσμα έχει ενδιαφέρον πέρα από το competitive programming. Για ομάδες software, e-commerce, marketing technology και επιχειρήσεις που σχεδιάζουν agentic workflows, το MARS λειτουργεί ως μελέτη πάνω σε ένα πρακτικό ερώτημα: πότε η εξειδίκευση, η σωστή δρομολόγηση και το μετρήσιμο feedback αξίζουν περισσότερο από έναν ακόμη γενικό agent; Η απάντηση συνδέεται με το πώς ένα AI workflow γίνεται επαναλήψιμο σύστημα εργασίας και όχι απλώς μια σειρά από prompts.

Contents

Το πρόβλημα δεν ήταν η έλλειψη agents, αλλά η λάθος εξειδίκευση

Πολλά multi-agent συστήματα οργανώνουν τη συνεργασία γύρω από στάδια παραγωγής: ένας agent σχεδιάζει, ένας γράφει κώδικα και ένας διορθώνει. Αυτή η διάταξη είναι εύκολη να περιγραφεί, αλλά αφήνει την επιλογή της σωστής αλγοριθμικής τεχνικής στο ίδιο βασικό μοντέλο. Σε προβλήματα όπου η λύση εξαρτάται από δυναμικό προγραμματισμό, γράφους, strings, γεωμετρία ή συνδυασμό θεμάτων, ο τίτλος «coder» δεν εγγυάται ότι το σύστημα έχει πρόσβαση στη σωστή γνώση τη σωστή στιγμή.

Οι συγγραφείς του MARS αντιμετωπίζουν το κενό αλλάζοντας τον άξονα της ομάδας. Οι agents δεν διαφέρουν κυρίως ως προς το στάδιο εργασίας, αλλά ως προς το γνωστικό αντικείμενο. Πρόκειται για prompt-only πλαίσιο: δεν εκπαιδεύεται νέο μοντέλο για κάθε ειδικό. Η ειδίκευση προκύπτει από prompts, περιγραφές θεμάτων και retrieval πάνω σε αλγοριθμική θεωρία.

Η διάκριση είναι κρίσιμη και για μεγάλα codebases. Ένα σύστημα που καταλαβαίνει ποιο υποσύστημα ή ποια τεχνική αφορά η εργασία έχει περισσότερες πιθανότητες να ανακτήσει χρήσιμη γνώση από ένα σύστημα που αλλάζει απλώς τίτλους ρόλων. Η ίδια αρχή εμφανίζεται στην τεκμηρίωση μεγάλων codebases με multi-agent AI: η χρησιμότητα εξαρτάται από την πρόσβαση στο σωστό context και όχι από τον αριθμό των personas.

Πώς σχηματίζεται η ομάδα των ειδικών

Το σύστημα ξεκινά από δεξαμενή έντεκα topic specialists. Κάθε specialist εξετάζει αν το πρόβλημα εμπίπτει στο πεδίο του, αν είναι σχετικό με τη γνώση του και με ποια εμπιστοσύνη μπορεί να συνεισφέρει. Η διαδικασία σχηματίζει ομάδα έως τριών agents και μια ξεχωριστή δοκιμή αποφασίζει ποιος μπορεί να ξεκινήσει τη λύση.

Η γνώση δεν αντλείται από τυχαία snippets κώδικα. Το retrieval γίνεται πάνω στο corpus του cp-algorithms, φιλτραρισμένο σύμφωνα με τα tags κάθε ειδικού και κωδικοποιημένο με Jina Embeddings v2. Αυτή η λεπτομέρεια είναι ουσιαστική: ο agent λαμβάνει θεωρητικό πλαίσιο για την αλγοριθμική τεχνική και όχι απλώς ένα παρόμοιο implementation που μπορεί να μην ταιριάζει στο νέο πρόβλημα.

Για μια επιχείρηση, το ανάλογο δεν είναι να δημιουργήσει δεκάδες personas με διαφορετικούς τίτλους. Είναι να χαρτογραφήσει πραγματικά πεδία γνώσης —π.χ. κατάλογος προϊόντων, φορολογικοί κανόνες, CRM, paid media, logistics— και να δρομολογεί κάθε εργασία μόνο στους agents που διαθέτουν την κατάλληλη, ελεγμένη βάση γνώσης. Η διαφορά ανάμεσα σε persona και specialist γίνεται ορατή και σε ένα private chatbot με RAG και ιδιόκτητη knowledge base: η πηγή, η έκδοση και τα δικαιώματα πρόσβασης είναι μέρος της ποιότητας.

Ένας κοινός κώδικας περνά από specialist σε specialist

Ο starter παράγει αρχική λύση σε C++17. Σε κάθε επόμενο βήμα, ο ενεργός specialist δεν δημιουργεί ανεξάρτητη πρόταση που θα συγχωνευθεί αργότερα. Βλέπει τον κοινό κώδικα, το υποπρόβλημα που του έχει ανατεθεί, μια συμπυκνωμένη περίληψη της προηγούμενης κατάστασης και το σχετικό retrieved context. Έτσι η ομάδα λειτουργεί σαν relay: το αντικείμενο εργασίας περνά από χέρι σε χέρι, αλλά παραμένει ένα.

Κάθε βήμα χρησιμοποιεί δύο κλήσεις προς το μοντέλο. Η πρώτη παράγει ή ενημερώνει το draft. Το πρόγραμμα εκτελείται πάνω στα δημόσια παραδείγματα του benchmark μέσω ExecEval. Η δεύτερη κλήση βλέπει την αναφορά και επιλέγει keep-code, repair-code ή no-change, μαζί με δομημένα πεδία παράδοσης στον επόμενο specialist.

Αυτή η σειριακή επεξεργασία αποφεύγει το κόστος συντονισμού πολλών ανεξάρτητων λύσεων. Η μελέτη αναφέρει ότι το 88% των task-runs ήταν multi-topic, όμως δεν χρειάστηκε ξεχωριστός μηχανισμός συμφιλίωσης: οι agents επεξεργάζονταν διαδοχικά το ίδιο draft. Αυτό είναι διαφορετικό από ένα branching pattern, όπου εξετάζονται πολλές διαδρομές παράλληλα· η σχετική ανάλυση για Recursive Agentic Reasoning δείχνει γιατί το branching έχει άλλο προφίλ κόστους και επιλογής.

Δύο τρόποι συνεργασίας specialists

Τι αλλάζει όταν το shared state είναι ο ίδιος κώδικας

Η σύγκριση περιγράφει τη δομή δύο multi-agent baselines του paper· δεν αποτελεί γενική κατάταξη όλων των coding agents.

Parallel ensemble

Πολλοί specialists παράγουν απομονωμένες προτάσεις και η ενοποίηση γίνεται αργότερα, με μεγαλύτερο coordination και wall-clock κόστος.

MARS relay

Έως τρεις specialists αλλάζουν διαδοχικά το ίδιο πρόγραμμα, με κοινό state, public-test feedback και δομημένο handoff.

Το execution feedback είναι φίλτρο, όχι απόδειξη ορθότητας

Όταν ο specialist προτείνει repair, το MARS το εκτελεί ξανά. Η αλλαγή γίνεται δεκτή μόνο αν μεταγλωττίζεται και δεν μειώνει τον αριθμό των δημόσιων tests που περνούν σε σχέση με το draft του ίδιου βήματος. Εάν αποτύχει, το σύστημα επαναφέρει την προηγούμενη εκδοχή. Σε 697 self-check decisions, το φίλτρο ανέτρεψε το 4,4% κατά μέσο όρο, με απόκλιση ±0,9 ποσοστιαίες μονάδες.

Το φίλτρο είναι χρήσιμο επειδή συνδέει μια γλωσσική πρόταση με παρατηρήσιμο αποτέλεσμα. Δεν πρέπει όμως να παρουσιαστεί ως πλήρης εγγύηση. Δεν βλέπει hidden tests, συγκρίνει μόνο το repair με το draft του ίδιου turn και δεν εμποδίζει έναν μεταγενέστερο specialist να αντικαταστήσει τον κώδικα. Οι ίδιοι οι συγγραφείς τονίζουν ότι κάθε παραγόμενος κώδικας πρέπει να εκτελείται σε sandbox.

Αυτό μεταφράζεται καθαρά σε επιχειρησιακά workflows: ένα agentic σύστημα χρειάζεται checks που μετρούν πραγματικό αποτέλεσμα —schema validation, test checkout, permissions, totals ή policy rules— αλλά κάθε check καλύπτει μόνο το πεδίο που έχει σχεδιαστεί να ελέγχει. Το enterprise AI harness γίνεται έτσι μέρος της αρχιτεκτονικής και όχι τελικός έλεγχος που προστίθεται αφού έχει ληφθεί η απόφαση.

Όρια στη συνεργασία για να μη γίνει το relay ατέρμονος κύκλος

Το MARS περιορίζει την ομάδα σε έως τρεις μοναδικούς specialists και το relay σε έως οκτώ βήματα. Σταματά όταν υπάρξει ρητό σήμα ολοκλήρωσης, όταν δεν μένει αχρησιμοποίητος επιλεγμένος specialist, όταν εξαντληθεί ο προϋπολογισμός βημάτων ή όταν δεν υπάρχει πρόοδος. Με δύο διαδοχικά no-progress events γίνεται αναδρομολόγηση και στα τρία η διαδικασία τερματίζεται.

Στο τέλος υπάρχει ένας infrastructure fixer μόνο για προβλήματα boilerplate, όπως I/O wiring, includes και πλάτος τύπων. Δεν είναι ένας απεριόριστος τελικός debugger. Στην αξιολόγηση άλλαξε μόλις ένα task, περίπου το 0,2% των task-runs, επομένως δεν εξηγεί το βασικό αποτέλεσμα.

Η αρχή είναι σημαντική για οποιαδήποτε παραγωγική υλοποίηση: ο agent χρειάζεται σαφή δικαιώματα, όριο βημάτων και συνθήκη εξόδου. Περισσότερες κλήσεις δεν ισοδυναμούν αυτόματα με καλύτερη απόφαση, ενώ κάθε επιπλέον agent αυξάνει χρόνο, κόστος και επιφάνεια σφάλματος. Αυτός είναι και ο λόγος που ένα terminal agent πρέπει να αξιολογείται ως ολόκληρο σύστημα και όχι μόνο ως το μοντέλο που γράφει την εντολή.

Τι έδειξε η κύρια αξιολόγηση στο CodeContests

Η κύρια δοκιμή καλύπτει 165 tasks από το test split του CodeContests, με instruction-tuned Gemma 4, θερμοκρασία 0 και όριο 4.096 tokens. Τα αποτελέσματα του βασικού πίνακα είναι μέσοι όροι τριών runs. Το MARS πέτυχε pass rate 0,624 ± 0,006, έναντι 0,48 για direct prompting. Η διαφορά αντιστοιχεί σε 14,4 ποσοστιαίες μονάδες.

Το Single-RAG έφτασε περίπου 0,529, το parallel ensemble 0,564 και το παλαιότερο base relay 0,552. Το CodeSIM παρέμεινε υψηλότερα, στο 0,731, αλλά με πολύ βαρύτερη διαδικασία. Οι συγγραφείς αναφέρουν 244,3 δευτερόλεπτα ανά task για το MARS και 817,5 για το CodeSIM rerun, δηλαδή περίπου 3,3 φορές χαμηλότερο wall-clock κόστος για το MARS.

Κύρια αξιολόγηση

Τα μετρημένα αποτελέσματα του MARS στο CodeContests

Οι τιμές αφορούν τα 165 tasks, το Gemma 4 backbone και το συγκεκριμένο evaluation harness της εργασίας· δεν είναι SLA για production ανάπτυξη λογισμικού.

165 tasksTest split του CodeContests
0,624 ± 0,006Pass rate του MARS
+14,4 μονάδεςΔιαφορά από το Direct
3,3×Χαμηλότερο wall-clock από CodeSIM rerun

Η σύγκριση χρειάζεται προσοχή. Οι μέθοδοι έχουν διαφορετικό αριθμό κλήσεων, tokens και μηχανισμούς αναζήτησης. Το αποτέλεσμα δείχνει trade-off μεταξύ ακρίβειας και υπολογιστικού κόστους· δεν αποδεικνύει ότι η εξειδίκευση μόνη της προκάλεσε όλη τη βελτίωση. Όπως εξηγεί και η ανάλυση για το πώς το benchmark harness μπορεί να αλλάξει τον νικητή, η μέθοδος εκτέλεσης και βαθμολόγησης είναι μέρος του αποτελέσματος.

Η διαφορά φαίνεται περισσότερο στα δυσκολότερα προβλήματα

Στα εύκολα tasks, οι επιδόσεις των συστημάτων βρίσκονταν ήδη κοντά στο 0,80–0,93, άρα υπήρχε μικρότερος χώρος διαφοροποίησης. Στη μεσαία κατηγορία, το MARS αναφέρεται στο 0,72 έναντι 0,59 του Direct. Στα δύσκολα προβλήματα, η απόσταση άνοιξε σε 0,40 έναντι 0,18.

Αυτό δεν σημαίνει ότι κάθε δύσκολη εργασία χρειάζεται πολλούς agents. Υποδηλώνει όμως ότι η θεματική δρομολόγηση και το feedback αποκτούν μεγαλύτερη αξία όταν το πρόβλημα απαιτεί περισσότερα του ενός είδη γνώσης. Στα δεδομένα, ομάδες τριών agents εμφανίστηκαν στο 82,4% των task-runs, δύο agents στο 15,8% και ένας μόνο στο 1,8%.

Παρά το μέγεθος της ομάδας, κατά μέσο όρο μόνο 1,35 specialists άλλαξαν τον κώδικα. Άρα η επιλογή ενός agent στην ομάδα δεν σημαίνει ότι πρέπει οπωσδήποτε να κάνει παρέμβαση. Η ικανότητα να αναγνωρίζει ότι δεν χρειάζεται αλλαγή είναι μέρος της αποτελεσματικής ενορχήστρωσης.

Τι ξεκαθαρίζουν τα transfer tests και τα ablations

Η σειρά Direct, Single-RAG, MARS διατηρήθηκε σε τρία backbones: Gemma 4, Qwen3.5-27B και GPT-5.4-mini. Στην Python, το MARS έφτασε 0,622 ± 0,015 έναντι 0,485 για Direct, με επιδόσεις κοντά στην έκδοση C++17 αλλά μεγαλύτερο χρόνο. Το PairCoder πέτυχε 0,705 στην Python, με περίπου 1,4 φορές μεγαλύτερο wall-clock κόστος από το MARS.

Στα ablations, η αφαίρεση του RAG μείωσε το pass rate από 0,624 σε 0,604. Η παραλλαγή με generalists χωρίς RAG έφτασε 0,615, μόλις 0,9 μονάδες κάτω από το πλήρες MARS και μέσα σε μία τυπική απόκλιση, αλλά χρειάστηκε 31% περισσότερο χρόνο και περισσότερες κλήσεις. Οι συγγραφείς επισημαίνουν σωστά ότι αυτή η γραμμή αλλάζει ταυτόχρονα και το retrieval, άρα δεν απομονώνει καθαρά την αξία της εξειδίκευσης.

Για έναν decision maker, το ώριμο συμπέρασμα δεν είναι «οι specialists κερδίζουν πάντα». Είναι ότι η αρχιτεκτονική συνδυάζει τέσσερα στοιχεία —δρομολόγηση, θεματικό context, κοινό state και execution feedback— και η συνολική τους επίδραση φαίνεται πιο σταθερή από μια απλή αύξηση παραλληλισμού.

Τι μπορεί να κρατήσει μια ομάδα προϊόντος ή e-commerce

Σε ένα e-commerce workflow, ένας agent για catalog quality, ένας για pricing rules και ένας για analytics δεν θα πρέπει να γράφουν τρεις ανεξάρτητες αναφορές που κάποιος θα συγχωνεύσει. Μπορούν να επεξεργάζονται διαδοχικά ένα κοινό, δομημένο αντικείμενο: αρχικό αίτημα, αλλαγές, αποτελέσματα ελέγχων, εκκρεμότητες και λόγος παράδοσης. Το pattern του structured relay packet είναι πιο χρήσιμο από την απλή ανταλλαγή ελεύθερου κειμένου.

Για marketing operations, το αντίστοιχο execution feedback μπορεί να είναι έλεγχος UTM, συμβατότητα με platform limits ή validation ενός feed — όχι υποκειμενική δήλωση του agent ότι «η καμπάνια φαίνεται σωστή». Για software teams, ο έλεγχος μπορεί να περιλαμβάνει tests, linting και sandboxed execution. Σε κάθε περίπτωση, το feedback πρέπει να είναι κοντά στο βήμα που παράγει την αλλαγή.

Η επιλογή γνώσης χρειάζεται επίσης πειθαρχία. Το MARS χρησιμοποιεί ένα συγκεκριμένο corpus και tags. Μια επιχείρηση χρειάζεται ιδιοκτησία των πηγών, versioning και όρια πρόσβασης. Χωρίς αυτά, ένας «specialist» είναι απλώς persona με πειστικό όνομα. Η ανθρώπινη εποπτεία παραμένει αναγκαία, όπως δείχνει η πρακτική ανάλυση για AI agents με context, δεδομένα και ανθρώπινο έλεγχο.

Το οικονομικό ερώτημα δεν λύνεται από το pass rate. Η ομάδα πρέπει να μετρήσει κόστος ανά επιτυχημένη εργασία, χρόνο μέχρι έγκριση και κόστος επανεπεξεργασίας. Η προσέγγιση για AI ROI ανά εργασία είναι καταλληλότερη από τη σύγκριση token spend χωρίς το αποτέλεσμα που παρήχθη.

Πώς μετατρέπεται το relay σε ελεγχόμενο production pilot

Ένα ασφαλές pilot ξεκινά από μία επαναλαμβανόμενη εργασία με σαφή inputs, outputs και validators. Δεν ξεκινά από γενική εντολή «βάλε πολλούς agents». Η ομάδα ορίζει ποια γνώση ανήκει σε κάθε specialist, ποιο κοινό state επιτρέπεται να αλλάζει και ποιο deterministic check πρέπει να περάσει πριν από κάθε handoff.

Το pilot χρειάζεται δίκαιο baseline. Η ίδια εργασία εκτελείται με single-agent ροή και με relay, με ίδια δεδομένα, όρια και τελικό reviewer. Μετριούνται success rate, χρόνος, κλήσεις, κόστος, αριθμός rollbacks και ανθρώπινη επανεπεξεργασία. Το κρυφό κόστος του AI coding βρίσκεται συχνά στο rework που δεν φαίνεται στο πρώτο output.

Production gate για specialist relay

Μην προσθέτετε agent αν δεν μπορείτε να ορίσετε γνώση, δικαίωμα και έλεγχο

Κάθε specialist χρειάζεται συγκεκριμένο scope, έκδοση πηγών, ελάχιστη πρόσβαση, κοινό schema παράδοσης, deterministic validator, όριο βημάτων, rollback και επώνυμο ανθρώπινο owner για τις εξαιρέσεις.

Από το MARS σε μετρήσιμο επιχειρησιακό pilot

  1. Step 1Επιλέξτε μία στενή εργασία

    Ξεκινήστε με ροή που έχει σταθερά inputs και αντικειμενικό αποτέλεσμα, όπως έλεγχο catalog feed, QA κώδικα ή επικύρωση campaign configuration.

  2. Step 2Χαρτογραφήστε πραγματικές ειδικότητες

    Ορίστε ποια domain γνώση δικαιολογεί κάθε specialist και αφαιρέστε ρόλους που διαφέρουν μόνο στο όνομα του prompt.

  3. Step 3Κλειδώστε τις πηγές και τα δικαιώματα

    Καταγράψτε corpus, έκδοση, owner, freshness και ελάχιστη πρόσβαση ώστε κάθε retrieval result να είναι ελέγξιμο.

  4. Step 4Ορίστε κοινό relay packet

    Μεταφέρετε state, αλλαγές, αποδείξεις, εκκρεμότητες και λόγο handoff σε σταθερό schema αντί για ελεύθερη συνομιλία.

  5. Step 5Βάλτε check μετά από κάθε αλλαγή

    Συνδέστε κάθε specialist με tests, schema validation, policy rules ή sandboxed execution που μετρά το δικό του αποτέλεσμα.

  6. Step 6Περιορίστε τον κύκλο

    Ορίστε μέγιστους specialists, βήματα, no-progress threshold, timeout και rollback πριν το pilot αγγίξει production δεδομένα.

  7. Step 7Συγκρίνετε με single-agent baseline

    Μετρήστε επιτυχία, χρόνο, κόστος, rollbacks και ανθρώπινο rework και κρατήστε το relay μόνο αν βελτιώνει το συνολικό αποτέλεσμα.

Το ουσιαστικό μάθημα για τους AI agents

Η σημαντικότερη συμβολή του MARS δεν είναι ένας ακόμη agent. Είναι η ιδέα ότι η ομάδα πρέπει να σχηματίζεται με βάση το περιεχόμενο του προβλήματος και κάθε παρέμβαση να συναντά γρήγορα ένα μετρήσιμο σήμα. Ο κοινός κώδικας μειώνει το reconciliation, το RAG δίνει στοχευμένη θεωρία και τα όρια βημάτων συγκρατούν το κόστος.

Για τις επιχειρήσεις, αυτό οδηγεί σε μια πρακτική σειρά προτεραιοτήτων: όρισε πραγματικές ειδικότητες, σύνδεσέ τες με ελεγμένες πηγές, κράτησε κοινό state, βάλε deterministic checks και όρισε πότε το σύστημα σταματά ή ζητά άνθρωπο. Η αξία του multi-agent design δεν βρίσκεται στον αριθμό των agents, αλλά στην ποιότητα της ανάθεσης και της επαλήθευσης.

Το paper παρέχει σοβαρή ένδειξη για competitive programming, όχι γενική εγγύηση για software delivery. Η σωστή επιχειρησιακή χρήση είναι να μετατραπεί η αρχιτεκτονική σε υπόθεση προς δοκιμή, με baseline, audit trail και σαφές publish ή deploy gate.

Αυτοματισμοί με ελεγχόμενη AI

Μετατρέψτε τους AI agents σε επαναλήψιμη επιχειρησιακή ροή

Η TWO DOTS σχεδιάζει αυτοματισμούς που συνδέουν εταιρική γνώση, συγκεκριμένα δικαιώματα, δομημένα handoffs, validators, audit trail και ανθρώπινη έγκριση πριν από κρίσιμες ενέργειες.

Frequently Asked Questions (FAQs)

Τι είναι το MARS;

Είναι prompt-only multi-agent πλαίσιο για competitive programming, όπου agents εξειδικευμένοι σε αλγοριθμικά θέματα δουλεύουν διαδοχικά πάνω στον ίδιο κώδικα.

Πώς διαφέρει από το planner–coder–debugger;

Οι ρόλοι καθορίζονται από γνωστικό πεδίο, όπως graphs ή dynamic programming, και όχι κυρίως από στάδιο παραγωγής.

Πού χρησιμοποιείται το RAG;

Κάθε specialist αντλεί σχετική θεωρία από φιλτραρισμένο corpus του cp-algorithms, ώστε το context να ταιριάζει στο αλγοριθμικό θέμα του.

Ποιο ήταν το βασικό αποτέλεσμα;

Στα 165 CodeContests tasks με Gemma 4, το MARS πέτυχε pass rate 0,624 ± 0,006, δηλαδή 14,4 ποσοστιαίες μονάδες πάνω από το Direct.

Πέτυχε καλύτερα από όλες τις μεθόδους;

Όχι. Ξεπέρασε το direct prompting και τα ελαφρύτερα prompt-only baselines, αλλά το CodeSIM και, στην Python, το PairCoder είχαν υψηλότερο pass rate με μεγαλύτερο wall-clock κόστος.

Τι εγγυάται το execution gate;

Μόνο ότι ένα repair μεταγλωττίζεται και δεν χειροτερεύει τα δημόσια tests του ίδιου βήματος. Δεν καλύπτει hidden tests ή όλες τις επόμενες αλλαγές.

Μπορεί να εφαρμοστεί αυτούσιο σε μια επιχείρηση;

Η μελέτη δεν το αποδεικνύει. Το pattern χρειάζεται domain-specific πηγές, validators, περιορισμένα δικαιώματα, sandbox, όρια κόστους και ανθρώπινη επίβλεψη.

Ποιο είναι το βασικό επιχειρησιακό συμπέρασμα;

Οι agents γίνονται πιο χρήσιμοι όταν η ανάθεση βασίζεται σε πραγματική γνώση, μοιράζονται δομημένο state και ελέγχονται με αντικειμενικά σήματα.

Newsletter

Enter your email address below to subscribe to our newsletter