Όταν δύο AI agents ανταλλάσσουν κρυφές, συνεχείς αναπαραστάσεις αντί για κανονικό κείμενο, είναι εύκολο να υποθέσουμε ότι «επικοινωνούν καλύτερα». Η μεγαλύτερη χωρητικότητα ενός latent καναλιού, όμως, δεν αποδεικνύει ότι ο δεύτερος agent χρησιμοποιεί πληροφορία σχετική με το συγκεκριμένο πρόβλημα. Μια νέα εργασία των Huixiang Zhang και Mahzabeen Emu προτείνει έναν αιτιακό έλεγχο που πηγαίνει πέρα από το τελικό accuracy και εξετάζει τι ακριβώς προκαλεί η παρουσία, η ταυτότητα και το περιεχόμενο του μηνύματος.
Για επιχειρήσεις που σχεδιάζουν multi-agent workflows, το συμπέρασμα είναι ουσιαστικό: ένα καλύτερο τελικό αποτέλεσμα δεν αρκεί για να πιστοποιήσει ότι η συνεργασία λειτουργεί όπως νομίζουμε. Η βελτίωση μπορεί να προκύπτει από πρόσθετο υπολογισμό, επαναχρησιμοποίηση context ή άλλη επίδραση που δεν εξαρτάται από χρήσιμη πληροφορία του αποστολέα.
Σύντομη απάντηση: η latent επικοινωνία AI agents δεν αποδεικνύεται από το bandwidth ή το τελικό accuracy. Χρειάζεται αιτιακός έλεγχος που αντικαθιστά ελεγχόμενα το μήνυμα και ξεχωρίζει αν ο receiver επηρεάζεται από την παρουσία, την ταυτότητα, το σχετικό περιεχόμενο ή την πρόσθετη αξία ενός δεύτερου agent.
Το πρόβλημα πίσω από την «αόρατη» επικοινωνία
Τα κλασικά multi-agent συστήματα ανταλλάσσουν κείμενο. Ο αποστολέας μετατρέπει την εσωτερική του επεξεργασία σε tokens και ο παραλήπτης διαβάζει αυτά τα tokens. Η latent επικοινωνία παρακάμπτει αυτή τη μετατροπή και μεταδίδει embeddings, hidden states ή KV caches. Θεωρητικά, έτσι διατηρείται περισσότερη πληροφορία και μειώνεται η απώλεια που προκαλεί η διακριτοποίηση σε λέξεις.
Η έρευνα επισημαίνει μια κρίσιμη διαφορά ανάμεσα στη χωρητικότητα και στη χρήση. Το γεγονός ότι ένα μήνυμα περιέχει πληροφορία δεν σημαίνει ότι ο receiver βασίζεται σε αυτή. Αντίστοιχα, το γεγονός ότι η απόδοση αλλάζει όταν ενεργοποιείται το κανάλι δεν αποδεικνύει ότι η αλλαγή οφείλεται στο περιεχόμενο του συγκεκριμένου παραδείγματος.
Αυτή η διάκριση είναι ιδιαίτερα σημαντική σε παραγωγικά AI συστήματα. Ένα workflow μπορεί να δείχνει καλύτερο σε ένα benchmark, αλλά να μην έχει πραγματική, σταθερή εξάρτηση από τη γνώση που υποτίθεται ότι προσφέρει ο upstream agent. Είναι η ίδια λογική που εξηγεί γιατί στη Causal AI η συσχέτιση δεν αρκεί για μια επιχειρηματική απόφαση: το ζητούμενο είναι ποια παρέμβαση προκαλεί ποια αλλαγή.
Τέσσερις ελεγχόμενες εκδοχές του ίδιου μηνύματος
Οι ερευνητές παρεμβαίνουν στο ακριβές σημείο όπου η αναπαράσταση του sender εισάγεται στον receiver. Διατηρούν σταθερά το context του receiver, τα βάρη του μοντέλου, το prompt template, τη διαδικασία decoding και τον υπόλοιπο υπολογισμό. Αλλάζουν μόνο το μήνυμα.
- Χωρίς μήνυμα: ο receiver δουλεύει χωρίς πληροφορία από τον sender.
- Μήνυμα από άλλο παράδειγμα: το μήνυμα έχει παραχθεί από τον ίδιο sender και από το ίδιο benchmark, αλλά αφορά διαφορετικό, περίπου ισομήκες test case.
- Self-generated μήνυμα: ο ίδιος ο receiver παράγει ένα μήνυμα μέσω της ίδιας διεπαφής και με αντιστοιχισμένο υπολογιστικό budget.
- Μήνυμα του τρέχοντος παραδείγματος: το πραγματικό latent μήνυμα που δημιουργήθηκε από τον sender για το εξεταζόμενο task.
Με αυτή τη διάταξη, η ανάλυση δεν συγκρίνει απλώς «με agents» και «χωρίς agents». Απομονώνει την παρουσία του καναλιού, την ταυτότητα του μηνύματος, την αξία του περιεχομένου που αφορά το συγκεκριμένο παράδειγμα και την πρόσθετη αξία ενός ξεχωριστού agent.
Οι τέσσερις παρεμβάσεις που απομονώνουν την αξία του μηνύματος
Οι πέντε μετρήσεις που ξεχωρίζουν σήμα από πραγματική χρήση
Το framework χρησιμοποιεί πέντε βασικές μετρήσεις. Το Positive Signaling, ή PS, εξετάζει αν μια μεταβλητή του sender —στη συγκεκριμένη εργασία κυρίως το αν η απάντησή του είναι σωστή— μπορεί να αποκωδικοποιηθεί από το latent μήνυμα. Αυτό δείχνει ότι πληροφορία έχει κωδικοποιηθεί, όχι ότι αξιοποιείται.
Το Positive Listening, ή PL, συγκρίνει την κατανομή προβλέψεων με το πραγματικό μήνυμα και χωρίς μήνυμα. Το Causal Influence of Communication, CIC, συγκρίνει το πραγματικό μήνυμα με μήνυμα άλλου παραδείγματος και εξετάζει αν η ταυτότητα του μηνύματος αλλάζει τις προβλέψεις.
Το Content-Attributable Gain, CAG, μετρά τη διαφορά στην απόδοση ανάμεσα στο μήνυμα του τρέχοντος και ενός άλλου παραδείγματος. Τέλος, το Self-Substitution Gap, SSG, συγκρίνει το μήνυμα του sender με ένα compute-matched μήνυμα που δημιούργησε ο receiver μόνος του. Έτσι διαχωρίζεται η αξία του σχετικού περιεχομένου από την αξία που προσφέρει ειδικά ένας δεύτερος agent.
Γιατί ένα σχεδόν μηδενικό αποτέλεσμα μπορεί να είναι παραπλανητικό
Στο GSM8K με Qwen3-4B, η συνολική επίδραση στην απόδοση ήταν -1,00 ποσοστιαία μονάδα. Η αποσύνθεση, όμως, έδειξε δύο αντίρροπες συνιστώσες: -6,17 μονάδες από την επίδραση ενός μηνύματος άλλου παραδείγματος και +5,17 μονάδες από το περιεχόμενο του σωστού παραδείγματος. Τα διαστήματα εμπιστοσύνης και των δύο συνιστωσών απέκλειαν το μηδέν.
Στο Qwen3-8B οι κατευθύνσεις αντιστράφηκαν: συνολική επίδραση +1,67 μονάδες, με +3,96 από το other-example μήνυμα και -2,29 από το CAG. Άρα δύο συστήματα μπορούν να έχουν παρόμοια συνολική μεταβολή και εντελώς διαφορετικό μηχανισμό.
Για ένα business dashboard αυτό είναι προειδοποίηση. Ένα μοναδικό aggregate KPI μπορεί να αποκρύπτει δύο μεγάλες επιδράσεις που αλληλοαναιρούνται. Αν αλλάξει το dataset, το μοντέλο ή η κατανομή των αιτημάτων, η εύθραυστη ισορροπία μπορεί να χαθεί. Γι’ αυτό και η συνεργασία πολλών LLMs πρέπει να αξιολογείται ανά μηχανισμό και όχι μόνο από τον μέσο τελικό βαθμό.
Τα αποτελέσματα στα απαιτητικότερα μαθηματικά
Στο MATH-500, το Qwen3-4B είχε συνολικό κέρδος 15,00 ποσοστιαίων μονάδων. Από αυτές, 8,33 μονάδες διατηρούνταν με μήνυμα άλλου παραδείγματος και 6,67 αποδίδονταν στο περιεχόμενο του τρέχοντος παραδείγματος. Το διάστημα εμπιστοσύνης του CAG ήταν από 0,42 έως 12,50 μονάδες.
Στο Qwen3-8B, το συνολικό κέρδος ήταν 10,00 μονάδες, αλλά κυριαρχούσε η επίδραση του other-example μηνύματος με 8,13 μονάδες. Το CAG ήταν 1,88 μονάδες και το διάστημα εμπιστοσύνης διέσχιζε το μηδέν. Η ίδια περίπου επιτυχία στο τελικό task, επομένως, δεν συνεπάγεται την ίδια εξάρτηση από πληροφορία σχετική με το πρόβλημα.
Τέσσερις αιτιακές επιδράσεις που δεν χωρούν σε ένα accuracy
Οι τιμές είναι point estimates σε ποσοστιαίες μονάδες από τα συγκεκριμένα πειράματα της εργασίας. Δεν είναι γενικά benchmarks ή στόχοι για παραγωγικά συστήματα.
−1,00 ppσυνολική επίδραση
GSM8K με Qwen3-4B: το σχεδόν μηδενικό aggregate κρύβει δύο αντίρροπες συνιστώσες.
−6,17 ppother-example επίδραση
Στο ίδιο run, ένα μήνυμα από άλλο παράδειγμα διατηρεί αρνητική επίδραση που δεν φαίνεται στο συνολικό score.
+5,17 ppContent-Attributable Gain
Το περιεχόμενο του σωστού GSM8K παραδείγματος αντισταθμίζει μεγάλο μέρος της αρνητικής other-example επίδρασης.
+10,00 ppSelf-Substitution Gap
Στο MATH-500 με Qwen3-8B, το SSG έχει διάστημα εμπιστοσύνης 95% από 2,50 έως 20,00 μονάδες.
Στο ARC-C οι επιδράσεις ήταν μικρότερες και τα διαστήματα περιλάμβαναν το μηδέν. Η έρευνα δεν παρουσιάζει αυτό ως απόδειξη αμελητέας επίδρασης: ένα διάστημα που περνά από το μηδέν σημαίνει αβεβαιότητα, όχι αυτομάτως ισοδυναμία.
Σχετικό περιεχόμενο δεν σημαίνει απαραίτητα αξία από δεύτερο agent
Το CAG και το SSG απαντούν σε διαφορετικές ερωτήσεις. Ένα μήνυμα μπορεί να περιέχει χρήσιμο περιεχόμενο για το παράδειγμα, αλλά ο receiver ίσως μπορεί να δημιουργήσει ισοδύναμο υλικό μόνος του με το ίδιο υπολογιστικό budget.
Στο GSM8K με Qwen3-4B, το CAG ήταν +5,17 μονάδες, ενώ το SSG ήταν -2,00 και το διάστημα εμπιστοσύνης περνούσε από το μηδέν. Το μήνυμα του sender ήταν καλύτερο από ένα άσχετο μήνυμα, όχι όμως αποδεδειγμένα καλύτερο από το compute-matched self-generated μήνυμα του receiver.
Στο MATH-500 με Qwen3-8B εμφανίστηκε το αντίστροφο μοτίβο: CAG +1,88, αλλά SSG +10,00 μονάδες, με διάστημα 95% από 2,50 έως 20,00. Αυτό δείχνει ότι ένας ξεχωριστός agent μπορεί να προσθέτει αξία ακόμη και όταν η απλή σύγκριση σωστού και άλλου παραδείγματος δείχνει μικρή διαφορά.
Η ευαισθησία του μοντέλου δεν ισοδυναμεί με επιχειρηματική αξία
Οι ερευνητές μέτρησαν επίσης αλλαγές στις κατανομές προβλέψεων με Jensen–Shannon divergence. Οι τιμές κάλυψαν πολλές τάξεις μεγέθους. Ορισμένα runs του Qwen3-4B έδειξαν μεγάλη ευαισθησία τόσο στην παρουσία όσο και στην ταυτότητα του μηνύματος, ενώ στο Qwen3-8B το CIC ήταν συχνά πολύ μικρότερο από το PL.
Αυτό δεν προέβλεπε αναγκαστικά την τελική επιτυχία. Στο MATH-500 υπήρχαν θετικά task-level αποτελέσματα ακόμη και με μικρή first-token divergence, ενώ μεγάλη ευαισθησία στο GSM8K ή στο ARC-C δεν σήμαινε θετικό συνολικό κέρδος. Οι μετρήσεις είναι συμπληρωματικές και δεν πρέπει να συγχωνεύονται σε έναν ασαφή «communication score».
Πώς πρέπει να αλλάξει η αξιολόγηση ενός multi-agent workflow
Η πρακτική ερμηνεία για ομάδες προϊόντος, automation και AI governance είναι ότι το A/B test «single agent εναντίον multi-agent» είναι μόνο η αρχή. Χρειάζονται ελεγχόμενες αντικαταστάσεις μηνυμάτων, αντιστοίχιση compute και paired ανάλυση στο επίπεδο του ίδιου παραδείγματος.
Ένα production audit μπορεί να ελέγχει αν η αφαίρεση του μηνύματος αλλάζει την πρόβλεψη, αν ένα μήνυμα από άλλο case προκαλεί παρόμοιο αποτέλεσμα, αν ο receiver αναπαράγει μόνος του την ίδια αξία και αν οι επιδράσεις διατηρούνται σε διαφορετικά task segments. Η μελέτη προσθέτει επίσης ελέγχους realism και instability, ώστε οι παρεμβάσεις να μη δημιουργούν τεχνητά, εκτός κατανομής inputs.
Έξι βήματα για αιτιακό audit ενός multi-agent workflow
- Step 1Κλειδώστε receiver και downstream compute
Κρατήστε σταθερά context, βάρη, prompt template, decoding και εργαλεία μετά το σημείο εισαγωγής του μηνύματος, ώστε η παρέμβαση να αλλάζει μία μεταβλητή.
- Step 2Μετρήστε το no-message baseline
Καταγράψτε task αποτέλεσμα και κατανομή πρόβλεψης χωρίς latent μήνυμα. Αυτή είναι η βάση για το Positive Listening.
- Step 3Αντικαταστήστε με άλλο πραγματικό case
Χρησιμοποιήστε message από τον ίδιο sender και την ίδια διεπαφή, με περίπου ίδιο μήκος αλλά διαφορετικό παράδειγμα, ώστε να ελέγξετε CIC και CAG χωρίς τεχνητό noise.
- Step 4Δημιουργήστε compute-matched self message
Δώστε στον receiver ισοδύναμο budget για να παράγει το δικό του μήνυμα και υπολογίστε SSG πριν δικαιολογήσετε το κόστος δεύτερου agent.
- Step 5Κάντε paired ανάλυση ανά segment
Συγκρίνετε τις ίδιες περιπτώσεις, αναφέρετε διαστήματα εμπιστοσύνης και ελέγξτε χωριστά δύσκολα tasks, edge cases και κρίσιμες επιχειρηματικές κατηγορίες.
- Step 6Συνδέστε αποτέλεσμα, κόστος και rollback
Παρακολουθήστε task value, latency, compute, receiver instability και αποτυχίες. Ορίστε ανθρώπινο override και επιστροφή σε ασφαλή ροή όταν ο μηχανισμός δεν επιβεβαιώνεται.
Σε επίπεδο διακυβέρνησης, αυτό ευθυγραμμίζεται με το NIST AI RMF: τα συστήματα πρέπει να αξιολογούνται στο πραγματικό context χρήσης, να τεκμηριώνουν τους περιορισμούς γενίκευσης και να παρακολουθούνται μετά την ανάπτυξη. Για agentic εφαρμογές, το OWASP προτείνει επιπλέον σαφή όρια αυτονομίας, logging και τεχνικούς μηχανισμούς ελέγχου.
Δεν πρέπει να γενικεύσουμε τα συγκεκριμένα ποσοστά σε κάθε σύστημα. Τα πειράματα έγιναν με Qwen3-4B και Qwen3-8B, στη μέθοδο latent relay, πάνω σε GSM8K, ARC-C και MATH-500, με συγκεκριμένες ρυθμίσεις decoding και περιορισμένα σύνολα παραδειγμάτων. Η αξία της εργασίας βρίσκεται κυρίως στη μεθοδολογία ελέγχου.
Τι σημαίνει για ROI, ασφάλεια και λογοδοσία
Για το ROI, ένας επιπλέον agent δικαιολογείται όταν προσθέτει αξία πέρα από ό,τι μπορεί να παράγει ο receiver με αντίστοιχο compute. Το SSG προσφέρει έναν πιο καθαρό τρόπο να εξεταστεί αυτή η υπόθεση από μια απλή σύγκριση accuracy και κόστους. Η ίδια ανάγκη για attribution εμφανίζεται όταν εξετάζουμε ποια ενέργεια ενός AI agent βοήθησε πραγματικά και όχι απλώς αν το τελικό task ολοκληρώθηκε.
Για την ασφάλεια, έχει σημασία να γνωρίζουμε αν ο receiver επηρεάζεται από τη δομή ή την παρουσία ενός latent μηνύματος ακόμη και όταν το περιεχόμενο δεν σχετίζεται με το task. Ένα τέτοιο μοτίβο θα άξιζε επιπλέον stress testing, χωρίς η παρούσα μελέτη να ισχυρίζεται ότι αποδεικνύει συγκεκριμένη ευπάθεια. Στην παραγωγή, τα δυναμικά δικαιώματα ελάχιστης πρόσβασης για AI agents περιορίζουν τη ζημιά ακόμη και όταν ένα μήνυμα επηρεάζει απρόβλεπτα τη συμπεριφορά.
Για τη λογοδοσία, το framework βοηθά να διαχωριστεί το «το σύστημα βελτιώθηκε» από το «ο agent A μετέφερε σχετική πληροφορία στον agent B». Αυτές είναι διαφορετικές δηλώσεις και απαιτούν διαφορετικά στοιχεία. Η διάκριση πρέπει να περνά και στο incident model, ώστε να είναι σαφές ποιος αναλαμβάνει όταν μια αυτοματοποίηση με AI agents αποτυγχάνει.
Οι περιορισμοί της μελέτης και η ασφαλής ερμηνεία
Η εργασία είναι preprint και αξιολογεί μία συγκεκριμένη υλοποίηση latent relay με Qwen3-4B και Qwen3-8B. Οι paired αναλύσεις περιλαμβάνουν 100 και 60 παραδείγματα GSM8K, 80 και 40 ARC-C, καθώς και 60 και 40 MATH-500 για τα δύο μεγέθη μοντέλου. Τα reported runs χρησιμοποιούν nucleus sampling με θερμοκρασία 0,6, top-p 0,95, όριο 2.048 tokens, thinking mode ενεργό, 40 latent steps και τέσσερα other-example μηνύματα ανά case.
Αυτές οι επιλογές κάνουν τα αποτελέσματα ελέγξιμα, όχι καθολικά. Ένα διάστημα εμπιστοσύνης που περνά από το μηδέν δεν αποδεικνύει αμελητέα επίδραση, ενώ ένα θετικό CAG δεν αποδεικνύει ότι ο δεύτερος agent αξίζει το κόστος του. Πριν από παραγωγική απόφαση χρειάζεται επανάληψη του audit με το πραγματικό μοντέλο, τα πραγματικά prompts, τις εταιρικές ροές, τα failure modes και τα όρια κινδύνου του οργανισμού.
Conclusion
Η latent επικοινωνία μπορεί να είναι πλούσια σε αναπαραστάσεις, αλλά η πραγματική συνεργασία δεν αποδεικνύεται από το bandwidth ούτε από ένα τελικό score. Ο αιτιακός έλεγχος δείχνει ότι οι συνολικές επιδράσεις μπορούν να κρύβουν αντίρροπες συνιστώσες και ότι η αξία του σχετικού περιεχομένου διαφέρει από την αξία ενός ξεχωριστού agent.
Για τις επιχειρήσεις, το χρήσιμο μήνυμα είναι απλό: αξιολογήστε τον μηχανισμό, όχι μόνο το αποτέλεσμα. Όσο τα AI workflows γίνονται πιο σύνθετα, η δυνατότητα να αποδείξουμε ποια πληροφορία μεταφέρθηκε, αν χρησιμοποιήθηκε και αν άξιζε το πρόσθετο κόστος θα γίνει βασικό μέρος του engineering και του governance.
Το κριτήριο πριν από την παραγωγή
Μην εγκρίνετε δεύτερο agent μόνο επειδή ανέβηκε το aggregate accuracy.
Αποδείξτε ότι το σχετικό μήνυμα αλλάζει το αποτέλεσμα, ότι η αξία δεν αναπαράγεται με ισοδύναμο self-compute και ότι το όφελος παραμένει στα κρίσιμα segments μετά το κόστος και τα failure modes.
Business automation and AI from TWO DOTS
Μετατρέψτε το multi-agent workflow σε ελέγξιμη επιχειρησιακή διαδικασία.
Η TWO DOTS σχεδιάζει AI αυτοματισμούς με σαφή όρια agents, καταγραφή μηνυμάτων και εργαλείων, μετρήσιμα acceptance tests, ανθρώπινα approvals και ασφαλή fallback όταν η συνεργασία δεν αποδεικνύει την αξία της.
Frequently Asked Questions (FAQs)
Τι είναι η latent επικοινωνία μεταξύ AI agents;
Είναι η μετάδοση συνεχών εσωτερικών αναπαραστάσεων, όπως embeddings, hidden states ή KV caches, χωρίς ενδιάμεση μετατροπή σε φυσική γλώσσα.
Το Positive Signaling αποδεικνύει ότι ο receiver χρησιμοποιεί το μήνυμα;
Όχι. Το PS δείχνει ότι μια μεταβλητή του sender μπορεί να αποκωδικοποιηθεί από το μήνυμα. Η χρήση απαιτεί αιτιακή αλλαγή στη συμπεριφορά του receiver όταν το μήνυμα αφαιρείται ή αντικαθίσταται.
Ποια είναι η διαφορά ανάμεσα σε PL και CIC;
Το PL συγκρίνει το τρέχον μήνυμα με την απουσία μηνύματος και μετρά επίδραση παρουσίας. Το CIC συγκρίνει τρέχον και other-example μήνυμα και μετρά αν η ταυτότητα του περιεχομένου αλλάζει την πρόβλεψη.
Τι μετρά το Content-Attributable Gain;
Το CAG είναι η διαφορά task performance ανάμεσα στο μήνυμα του τρέχοντος παραδείγματος και σε περίπου ισομήκες μήνυμα άλλου παραδείγματος από τον ίδιο sender.
Τι προσθέτει το Self-Substitution Gap;
Το SSG συγκρίνει το μήνυμα του sender με compute-matched μήνυμα που παράγει ο receiver μόνος του. Έτσι ελέγχει αν ένας ξεχωριστός agent προσθέτει αξία πέρα από ισοδύναμο πρόσθετο compute.
Γιατί χρησιμοποιείται μήνυμα από άλλο παράδειγμα;
Επειδή διατηρεί τον ίδιο sender, την ίδια διεπαφή και παρόμοιο μήκος, αλλά αφαιρεί το περιεχόμενο του εξεταζόμενου task. Είναι πιο ρεαλιστικός έλεγχος από αυθαίρετο θόρυβο.
Γενικεύονται τα ποσοστά σε κάθε multi-agent σύστημα;
Όχι. Οι τιμές αφορούν συγκεκριμένα μοντέλα, benchmarks και ρυθμίσεις latent relay. Αυτό που μεταφέρεται ευρύτερα είναι η μεθοδολογία των ελεγχόμενων αντικαταστάσεων.
Ποιο είναι το πρώτο πρακτικό βήμα για μια επιχείρηση;
Να προσθέσει no-message, other-example και compute-matched self-substitution δοκιμές στο ίδιο evaluation set, με paired αποτελέσματα, διαστήματα εμπιστοσύνης, κόστος, latency και ανθρώπινο rollback.