XKV: όταν οι AI agents επικοινωνούν χωρίς να γράφουν μηνύματα

Το XKV μεταφέρει γνώση ανάμεσα σε AI agents μέσω KV caches, μειώνοντας latency χωρίς κοινό tokenizer. Δείτε τα αποτελέσματα, τα όρια και τους όρους για ασφαλές pilot.

Το XKV δοκιμάζει μια ριζικά διαφορετική απάντηση στο ακριβό handoff ανάμεσα σε AI agents: αντί ο ένας agent να παράγει κείμενο και ο άλλος να το διαβάζει ξανά, ένας μικρός εκπαιδεύσιμος translator μεταφέρει πληροφορία απευθείας ανάμεσα στις key-value caches δύο παγωμένων γλωσσικών μοντέλων.

Στα 45 dataset–model-pair settings της εργασίας, το XKV πέτυχε το υψηλότερο συνολικό macro score, μετέφραζε ένα ζεύγος caches σε 5,8 ms αντί 59,9 ms για το LCF-X και χρησιμοποίησε 76,1% λιγότερες εκπαιδεύσιμες παραμέτρους. Το αποτέλεσμα είναι ερευνητικό και στενό: δείχνει ότι η latent επικοινωνία μπορεί να είναι γρήγορη και ανταγωνιστική σε split-evidence reasoning, όχι ότι κάθε multi-agent workflow πρέπει να εγκαταλείψει τα αναγνώσιμα μηνύματα.

Contents

Γιατί το text handoff είναι ακριβό

Η φυσική γλώσσα είναι το πιο φορητό interface ανάμεσα σε διαφορετικά μοντέλα. Δεν απαιτεί κοινό tokenizer, ίδιο αριθμό layers ή πρόσβαση στις εσωτερικές αναπαραστάσεις. Είναι επίσης αναγνώσιμη από ανθρώπους, μπορεί να αποθηκευτεί σε logs και επιτρέπει σε μια ομάδα να εξετάσει τι ακριβώς ισχυρίστηκε ο sender.

Η ευκολία έχει υπολογιστικό κόστος. Ο sender κάνει autoregressive decoding του ενδιάμεσου μηνύματος, ο receiver κάνει tokenization και prefill του ίδιου περιεχομένου και το μήνυμα γράφεται χωρίς άμεση εικόνα του τι έχει ήδη κωδικοποιήσει ο παραλήπτης. Όταν το handoff βρίσκεται στο κρίσιμο μονοπάτι μιας απάντησης, αυτό το decode–encode loop προσθέτει latency πριν ξεκινήσει η ουσιαστική εργασία του δεύτερου μοντέλου.

Το πρόβλημα συνδέεται με τον ευρύτερο σχεδιασμό multi-agent συστημάτων με ελεγχόμενο κοινό state. Η γρήγορη μεταφορά πληροφορίας είναι χρήσιμη μόνο όταν ownership, χρονική σειρά και επιτρεπόμενες ενέργειες παραμένουν σαφή.

Από το C2C και το LCF-X στο XKV

Οι προηγούμενες cache-to-cache προσεγγίσεις απέδειξαν ότι δύο μοντέλα μπορούν να ανταλλάξουν περισσότερο από tokens. Το C2C υποστηρίζει ετερογενή μοντέλα, αλλά ευθυγραμμίζει θέσεις που προέρχονται από το ίδιο υποκείμενο input. Αυτό δεν καλύπτει ένα handoff όπου οι agents έχουν δει διαφορετικά documents.

Το LCF-X αφαίρεσε την απαίτηση κοινού context μέσω position-free pooling: συμπιέζει την cache του Sharer σε summary και τη συνδυάζει με την κατάσταση του Receiver. Σύμφωνα με τους συγγραφείς του XKV, τρεις περιορισμοί παραμένουν. Το summary αποφασίζεται μόνο από την cache του Sharer, κάθε θέση ενός receiver layer λαμβάνει το ίδιο εξωτερικό summary και η αρχική διατύπωση υποθέτει ίδιο αριθμό layers και συμβατή KV γεωμετρία.

Text-to-text

Ο Sharer παράγει αναγνώσιμο μήνυμα και ο Receiver το κωδικοποιεί ξανά. Είναι φορητό και ελέγξιμο, αλλά πληρώνει autoregressive decoding στο κρίσιμο μονοπάτι.

Αναγνώσιμο traceΥψηλότερο latency

LCF-X

Μεταφέρει position-free summary από την cache του Sharer χωρίς κοινό context. Παραμένει sender-centric και χρησιμοποιεί layer-local single-summary conditioning.

Latent channelSharer-only summary

XKV

Κάνει pooling και στις δύο caches, ευθυγραμμίζει τα layers σε κοινή μνήμη και αφήνει κάθε θέση του Receiver να ανακτήσει διαφορετικό residual.

Receiver-awareNative KV geometry

Το XKV δεν είναι άλλη μία τεχνική συμπίεσης για long context. Στόχος του είναι η μεταφορά συμπληρωματικής γνώσης ανάμεσα σε δύο frozen language models, ώστε ο Receiver να απαντήσει χρησιμοποιώντας και την πληροφορία που έχει ήδη κωδικοποιήσει ο Sharer.

Η αρχιτεκτονική του XKV: «τι» και «πού»

Η μέθοδος χωρίζει το πρόβλημα σε δύο ερωτήσεις. Η πρώτη είναι τι αξίζει να επικοινωνηθεί. Το XKV χρησιμοποιεί learned-query attention και στις δύο KV caches, κρατώντας πολλαπλά candidate summaries ανά layer και KV head. Έτσι η πληροφορία του Sharer αξιολογείται σε σχέση με όσα έχει ήδη ο Receiver, αντί να συμπιέζεται ως ανεξάρτητο sender-authored μήνυμα.

Η δεύτερη ερώτηση είναι πού πρέπει να γραφτεί η πληροφορία. Κάθε raw θέση της receiver cache λειτουργεί ως query προς μια συμπαγή κοινή μνήμη. Ένας shared decoder παράγει gated residuals στο native KV geometry του Receiver. Η cache δεν αντικαθίσταται· ενημερώνεται με residual correction, ώστε διαφορετικές θέσεις να μπορούν να ανακτήσουν διαφορετικό συνδυασμό από τα διαθέσιμα summaries.

Ο πυρήνας του XKV

Το «τι θα περάσει» κοιτά και τις δύο caches· το «πού θα γραφτεί» το αποφασίζει ο Receiver

Η διάκριση ανάμεσα σε joint communication memory και position-specific retrieval αφαιρεί το single-summary bottleneck χωρίς να αλλάζει τα βάρη των δύο base models.

Τα output heads για keys και values αρχικοποιούνται στο μηδέν. Πριν από την εκπαίδευση, ο translator αναπαράγει ακριβώς τη receiver-only συμπεριφορά. Κατά την εκπαίδευση μαθαίνει μόνο τη διόρθωση της cache, ενώ τα δύο LLMs παραμένουν frozen. Στο inference η ενημέρωση γίνεται μία φορά πριν από το κανονικό greedy decoding και δεν προστίθεται νέα εργασία σε κάθε παραγόμενο token.

Πώς γεφυρώνει ετερογενή μοντέλα

Οι εσωτερικές διαστάσεις δύο LLMs δεν είναι αυτονόητα συμβατές. Μπορεί να διαφέρουν σε οικογένεια, βάθος, αριθμό KV heads, head dimension και tokenizer. Το XKV χρησιμοποιεί learned layer map ώστε τα pooled summaries του Sharer να ευθυγραμμιστούν στον αριθμό layers του Receiver. Όταν τα βάθη είναι ίδια, εφαρμόζεται identity mapping.

Μετά την ευθυγράμμιση, τα summaries των δύο πλευρών συνενώνονται, περνούν από bottleneck και αναμειγνύονται με self-attention. Η κοινή μνήμη έχει ένα token ανά receiver layer, άρα το μήκος της εξαρτάται από το βάθος του Receiver και όχι από το μήκος των prompts. Ο decoder, το gate και τα output heads μοιράζονται μεταξύ layers, ενώ learned layer embeddings διατηρούν την ταυτότητα κάθε layer.

Αυτή η ευελιξία έχει πρακτικό όριο: η μέθοδος χρειάζεται πρόσβαση στις KV caches και εκπαίδευση translator για συγκεκριμένο ordered model pair. Ένα κλειστό API που επιστρέφει μόνο κείμενο δεν παρέχει το απαραίτητο εσωτερικό state.

Το πείραμα των 45 settings

Η αξιολόγηση χρησιμοποίησε Qwen3-0.6B, Gemma-3-1B και Llama-3.2-3B ως Sharer και Receiver. Το πλήρες 3×3 ordered grid έδωσε εννέα ζεύγη: έξι ετερογενή και τρία ίδιας οικογένειας. Οι δοκιμές κάλυψαν ROPES, MuSiQue και HotpotQA-bridge για generative multi-hop QA, καθώς και QASC και StrategyQA για classification-style reasoning. Έτσι προέκυψαν 45 dataset–model-pair cells.

Σε κάθε παράδειγμα, τα υποστηρικτικά στοιχεία χωρίζονταν ντετερμινιστικά ανάμεσα στους δύο ρόλους. Η ερώτηση και, όπου υπήρχαν, οι επιλογές απάντησης ήταν ορατές και στα δύο μοντέλα, αλλά τα evidence contexts ήταν συμπληρωματικά. Για τα generative datasets η εργασία αναφέρει exact match και F1· για τα classification datasets accuracy.

Οι baselines ήταν text-to-text και μια ενισχυμένη ετερογενής έκδοση του LCF-X. Στις latent μεθόδους εκπαιδεύτηκε μόνο το communication module. Κάθε πείραμα εκτελέστηκε μία φορά σε Nvidia A100 80GB, Ubuntu 22.04 και CUDA 12.2, στοιχείο που πρέπει να συνοδεύει κάθε ανάγνωση των latency αποτελεσμάτων.

Τι δείχνουν τα αποτελέσματα ποιότητας

Στη συγκέντρωση των 45 cells, το XKV είχε macro native score 52,37, έναντι 49,76 για το LCF-X και 48,86 για το text-to-text. Ήταν καλύτερο ή ισόβαθμα καλύτερο σε 31 από τα 45 cells και είχε μέση κατάταξη 1,37. Το LCF-X ήταν ισχυρότερο baseline στα τρία generative QA datasets, ενώ το text-to-text στα δύο classification datasets.

Η εικόνα δεν είναι καθολική νίκη. Το XKV ξεπέρασε κατά μέσο όρο το LCF-X και στα πέντε datasets, αλλά το text-to-text παρέμεινε οριακά καλύτερο στο QASC κατά 0,27 ποσοστιαίες μονάδες. Σε επιμέρους model pairs υπάρχουν επίσης cells όπου άλλο πρωτόκολλο κερδίζει. Το χρήσιμο εύρημα είναι ότι το XKV παρέμεινε ανταγωνιστικό και στα δύο είδη task, όχι ότι η latent επικοινωνία υπερέχει πάντα.

Στο ROPES, η μέση επίδοση του XKV ήταν 50,48 exact match και 56,99 F1, έναντι 45,86/52,79 για το LCF-X. Η διαφορά αντιστοιχεί σε 4,62 EM και 4,20 F1 μονάδες στο συγκεκριμένο experimental setup. Αυτά τα scores δεν είναι γενικό benchmark για customer support, marketing, e-commerce ή tool-use agents.

Latency και εκπαιδεύσιμες παράμετροι

Το ισχυρότερο αποτέλεσμα βρίσκεται στο κόστος του διαύλου. Σε όλα τα 45 cells, ο XKV translator είχε μέσο χρόνο 5,8 ms, ενώ ο LCF-X fusor 59,9 ms: διαφορά 10,3×. Το μέσο end-to-end latency μειώθηκε από 227,9 ms σε 167,6 ms, δηλαδή κατά 26,4%. Σε σχέση με text-to-text, το XKV ήταν 6,8× ταχύτερο end to end, καθώς απέφευγε την autoregressive παραγωγή ενδιάμεσου μηνύματος.

XKV στα 45 dataset–model-pair cells

Μέσες τιμές της εργασίας στο συγκεκριμένο A100 setup· το macro score συνδυάζει F1 για generative QA και accuracy για classification.

52,37Macro native score
5,8 msTranslator latency
167,6 msEnd-to-end latency
4,55 εκατ.Trainable parameters

Η διαφορά προκύπτει από την αρχιτεκτονική. Το direct pooling συμπιέζει τις positions σε λίγα slots με μία vectorized λειτουργία, ενώ το span pooling του LCF-X επεξεργάζεται μεταβλητού μήκους spans και μεγαλώνει με το context. Στα πειράματα, ο translator του XKV κινούνταν περίπου στα 5–10 ms και ο LCF-X fusor από 31 έως 123 ms.

Το XKV είχε 4,55 εκατομμύρια εκπαιδεύσιμες παραμέτρους έναντι 19,03 εκατομμυρίων για το LCF-X, μείωση 76,1%. Αυτό δεν σημαίνει ότι ολόκληρο το multi-agent σύστημα είναι μικρό ή φθηνό: και τα δύο frozen μοντέλα εξακολουθούν να κάνουν prefill και ο Receiver εξακολουθεί να κάνει decoding της τελικής απάντησης.

Τι αποκαλύπτουν τα ablations

Τα ablations καλύπτουν QASC, ROPES και StrategyQA σε 27 αντιστοιχισμένα cells. Η αφαίρεση του receiver pooling, ώστε η μνήμη να χτίζεται μόνο από τον Sharer, μείωσε τη μέση βαθμολογία κατά 0,46 μονάδες και εξοικονόμησε 1,1 ms. Αυτό υποστηρίζει την υπόθεση ότι το «τι θα σταλεί» ωφελείται όταν λαμβάνει υπόψη και το state του παραλήπτη.

Η αφαίρεση του position-specific receiver cross-attention είχε μέση πτώση 0,83 μονάδες και πτώση 1,98 στο QASC. Η αντικατάσταση του direct pooling με το span pooling του LCF-X αύξησε το component latency από 5,8 σε 39,1 ms και μείωσε τη μέση βαθμολογία κατά 0,94. Οι δοκιμές απομόνωσης δεν αποδεικνύουν κάθε αιτιώδη ερμηνεία, αλλά δείχνουν ότι και οι τρεις σχεδιαστικές επιλογές συνεισφέρουν.

Η σωστή ανάγνωση μοιάζει με το paired evaluation ενός AI skill: αλλάζουμε ένα στοιχείο, κρατάμε το baseline ορατό και εξετάζουμε μαζί ποιότητα, latency και διαδρομή εκτέλεσης.

Τι μπορεί να σημαίνει για enterprise AI

Το XKV παρουσιάζει μια πιθανή κατεύθυνση για workloads όπου η συμπληρωματική πληροφορία είναι ήδη κωδικοποιημένη σε διαφορετικά μοντέλα και το text decoding αποτελεί πραγματικό bottleneck. Ένας research agent θα μπορούσε θεωρητικά να μεταφέρει latent state σε verifier, ή ένας agent με επιτρεπόμενη πρόσβαση σε συγκεκριμένα έγγραφα να τροφοδοτήσει έναν Receiver χωρίς μεγάλο ενδιάμεσο memo.

Η δυνατότητα αυτή είναι πιο κοντά σε εξειδικευμένη υποδομή inference παρά σε prompt engineering. Απαιτεί πρόσβαση στις caches, σταθερότητα εσωτερικών interfaces, pair-specific εκπαίδευση και επανέλεγχο όταν αλλάζει model version ή cache geometry. Η εμπειρία από multi-agent orchestration σε federated learning δείχνει την ίδια αρχή: ο learned συντονισμός χρειάζεται deterministic validation και resource controls πριν αποκτήσει επιχειρησιακό ρόλο.

Για marketing ή e-commerce ομάδες, η εργασία δεν περιγράφει έτοιμο plug-in. Προσφέρει όμως κριτήριο σχεδιασμού: δεν χρειάζεται κάθε model-to-model handoff να είναι ένα μεγάλο φυσικογλωσσικό μήνυμα, ειδικά όταν ο χρόνος απόκρισης είναι κρίσιμος. Από την άλλη, όταν το αποτέλεσμα πρόκειται να επηρεάσει πελάτη, παραγγελία, campaign budget ή εταιρικό αρχείο, το αναγνώσιμο trace παραμένει λειτουργική απαίτηση.

Auditability, ασφάλεια και fallback

Η latent μνήμη δεν είναι ανθρώπινα αναγνώσιμο μήνυμα. Αυτό δυσκολεύει debugging, attribution και απόδειξη της προέλευσης μιας τελικής απάντησης. Η ποιότητα στη μελέτη μετρήθηκε από downstream answers, όχι από ανεξάρτητη επιθεώρηση του περιεχομένου που μεταφέρθηκε ανάμεσα στις caches.

Ένα production design χρειάζεται policy για το ποιο context επιτρέπεται να περάσει, tests για data leakage και isolation, versioning του translator, monitoring ανά model pair και fallback σε αναγνώσιμη text επικοινωνία. Η ασφάλεια ενός agentic AI stack πρέπει να καλύπτει τόσο τα εργαλεία και τις ενέργειες όσο και τα ενδιάμεσα states, τα logs και το retention τους.

Το fallback δεν είναι ένδειξη αποτυχίας. Είναι ο τρόπος με τον οποίο το σύστημα επιστρέφει σε ελέγξιμη λειτουργία όταν λείπει cache access, αλλάζει το model pair, εντοπίζεται distribution shift ή απαιτείται ανθρώπινη έγκριση. Το ίδιο ισχύει στη συμπεριφορική δοκιμή των AI agents: η επιτυχία της τελικής απάντησης δεν αρκεί αν η διαδρομή παρακάμπτει permissions, verification ή human handoff.

Ένα πρακτικό pilot αξιολόγησης

Η ομάδα πρέπει πρώτα να βρει handoffs όπου το text decoding είναι μετρημένο bottleneck και όπου και τα δύο μοντέλα μπορούν τεχνικά να εκθέσουν τις απαραίτητες caches. Έπειτα χρειάζεται paired benchmark με τα ίδια tasks, τα ίδια ordered model pairs, ίδιο hardware και σαφές text-to-text baseline.

Επτά βήματα για ασφαλές XKV pilot

  1. Step 1Ορίστε το cross-context handoff

    Καταγράψτε ποια συμπληρωματική πληροφορία κρατά ο Sharer, τι γνωρίζει ο Receiver και γιατί κανένα context δεν αρκεί μόνο του.

  2. Step 2Μετρήστε το text baseline

    Συλλέξτε ποιότητα απάντησης, p50 και p95 latency, tokens, prefill, decoding και συνολικό κόστος στο πραγματικό workload.

  3. Step 3Κλειδώστε το model pair

    Ορίστε ακριβείς εκδόσεις Sharer και Receiver, tokenizer, layer count και KV geometry ώστε το learned bridge να είναι αναπαραγώγιμο.

  4. Step 4Εκπαιδεύστε και απομονώστε τον translator

    Κρατήστε τα base models frozen, διαχωρίστε training και evaluation evidence και καταγράψτε version, data lineage και configuration.

  5. Step 5Ελέγξτε leakage και αστοχίες

    Δοκιμάστε μη επιτρεπόμενο context, missing evidence, adversarial inputs, stale caches και αλλαγές model version πριν από πραγματική χρήση.

  6. Step 6Διατηρήστε αναγνώσιμο observability

    Καταγράψτε input provenance, output, latency, model pair, translator version και λόγο fallback χωρίς να εκθέτετε ευαίσθητα states.

  7. Step 7Βάλτε text και human fallback

    Επιστρέψτε σε ελέγξιμο μήνυμα ή ανθρώπινη έγκριση όταν η συμβατότητα, η εμπιστοσύνη ή η επιχειρησιακή πολιτική δεν επαρκούν.

Για workflows πάνω σε εταιρικά έγγραφα, το generative question answering με ελεγχόμενες πηγές προσφέρει πρακτικό παράδειγμα για permissions, provenance και human review. Το latent channel μπορεί να μειώνει χρόνο, αλλά δεν πρέπει να αφαιρεί τα τεκμήρια που χρειάζεται ο τελικός χρήστης.

Τι κρατάμε από το XKV

Το XKV δείχνει ότι η επικοινωνία ανάμεσα σε ετερογενή LLMs δεν χρειάζεται πάντα να περνά από φυσική γλώσσα. Με joint pooling των δύο caches, ευθυγράμμιση layers και position-specific residual updates, πέτυχε καλύτερο συνολικό score και πολύ χαμηλότερο communication latency από τα δύο baselines στο συγκεκριμένο ερευνητικό setup.

Το σημαντικό επιχειρησιακό συμπέρασμα δεν είναι «καταργήστε τα μηνύματα». Είναι να ξεχωρίσουμε τα machine-to-machine handoffs που χρειάζονται ταχύτητα από τα σημεία όπου απαιτούνται auditability, εξήγηση και ανθρώπινη ευθύνη. Η επικοινωνία ανάμεσα σε AI agents πρέπει να αξιολογείται ως ελεγχόμενος δίαυλος δεδομένων και όχι ως αόρατη τεχνική λεπτομέρεια.

The TWO DOTS σχεδιάζει Αυτοματισμούς Επιχειρήσεων & AI με χαρτογράφηση ροής, permissions, baselines, error handling, monitoring και human handoff πριν ένα σύστημα αποκτήσει πρόσβαση σε CRM, e-shop, ERP, email ή λειτουργικά εργαλεία.

Από το paper στο ελεγχόμενο pilot

Μετρήστε το handoff των AI agents πριν αλλάξετε τον δίαυλο επικοινωνίας

Η TWO DOTS χαρτογραφεί cross-context ροές, text baselines, model pairs, permissions, observability και fallback ώστε ένα AI workflow να κριθεί στο δικό σας latency, στα δικά σας δεδομένα και στο πραγματικό επιχειρησιακό ρίσκο.

Frequently Asked Questions (FAQs)

Τι είναι το XKV;

Το XKV είναι εκπαιδεύσιμος translator που συνδυάζει τις KV caches δύο frozen language models σε κοινή latent μνήμη και παράγει residual updates στο native cache format του Receiver.

Χρειάζονται τα δύο μοντέλα ίδιο tokenizer ή ίδιο βάθος;

Όχι. Η μέθοδος σχεδιάστηκε για μοντέλα που μπορεί να διαφέρουν σε οικογένεια, αριθμό layers, KV heads, head dimension και tokenizer, χρησιμοποιώντας learned ευθυγράμμιση προς τον Receiver.

Γιατί το XKV είναι ταχύτερο από την ανταλλαγή κειμένου;

Αποφεύγει το autoregressive decoding του ενδιάμεσου μηνύματος και την επανεκωδικοποίησή του. Στη μελέτη ήταν 6,8× ταχύτερο end to end από το text-to-text baseline.

Πόσο γρήγορος ήταν ο translator;

Ο μέσος χρόνος ήταν 5,8 ms στα 45 dataset–model-pair cells, έναντι 59,9 ms για τον LCF-X fusor. Οι τιμές αφορούν το συγκεκριμένο A100 setup και μία εκτέλεση ανά πείραμα.

Κέρδισε το XKV σε όλα τα datasets;

Ξεπέρασε κατά μέσο όρο το LCF-X και στα πέντε datasets και το text-to-text στα τέσσερα από τα πέντε. Στο QASC το text baseline ήταν καλύτερο κατά 0,27 ποσοστιαίες μονάδες.

Μπορεί να χρησιμοποιηθεί με κλειστά LLM APIs;

Όχι όταν το API επιστρέφει μόνο κείμενο και δεν δίνει πρόσβαση στις απαραίτητες KV caches ή σε ισοδύναμο εσωτερικό state. Το XKV δεν είναι prompt-layer πρωτόκολλο.

Ποιος είναι ο βασικός κίνδυνος της latent επικοινωνίας;

Το μεταφερόμενο state δεν είναι ανθρώπινα αναγνώσιμο, άρα debugging, provenance, data isolation και compliance χρειάζονται ξεχωριστό observability layer και ασφαλές fallback σε κείμενο ή άνθρωπο.

Είναι το XKV έτοιμο για enterprise παραγωγή;

Η εργασία δείχνει ερευνητική δυνατότητα σε μικρά open models και split-evidence QA. Παραγωγική χρήση απαιτεί pair-specific εκπαίδευση, versioning, δικά σας benchmarks, security tests, monitoring και human-readable fallback.

Newsletter

Enter your email address below to subscribe to our newsletter