Με πάνω από 20 χρόνια εμπειρίας, μεταμορφώνουμε την ψηφιακή σας παρουσία. Εξειδικευόμαστε στην κατασκευή ιστοσελίδων και E-Shop, το SEO και το Digital Marketing, τα ERP λογισμικά και τους έξυπνους αυτοματισμούς που απογειώνουν την επιχείρησή σας.
Τα Semantic Overlays έχουν αξία μόνο όταν provenance, δικαιώματα εργαλείων και ανθρώπινη έγκριση ελέγχονται μαζί.
Απάντηση πρώτα: τα Semantic Overlays προτείνουν ένα μη λεκτικό κανάλι provenance μέσα στο μοντέλο, ώστε ένα span να παραμένει αναγνώσιμο αλλά οι οδηγίες του να μη θεωρούνται εκτελέσιμες. Τα αποτελέσματα απέναντι στο prompt injection είναι ισχυρά στα πέντε benchmarks της εργασίας, όμως η μέθοδος παραμένει ερευνητική, εξαρτάται από σωστό marking στο serving stack και δεν αντικαθιστά δικαιώματα, validation ή ανθρώπινη έγκριση.
Τα Semantic Overlays προσθέτουν μη λεκτική provenance στα AI, ώστε μη έμπιστο περιεχόμενο να παραμένει αναγνώσιμο χωρίς να αποκτά εκτελεστική ισχύ.
Τι θα άλλαζε αν ένα AI μπορούσε να διαβάζει ένα έγγραφο, αλλά να γνωρίζει με σήμα που το ίδιο το κείμενο δεν μπορεί να αντιγράψει ότι οι οδηγίες μέσα του δεν έχουν εξουσία; Η εργασία Semantic Overlays του Joshua Penman μεταφέρει αυτή τη διάκριση από τις λέξεις στο residual stream ενός παγωμένου language model. Μικροί εκπαιδευμένοι adapters γράφουν μια annotation μόνο στις επιλεγμένες θέσεις του prompt κατά το prefill.
Η πιο σημαντική εφαρμογή είναι ένα overlay με σημασία «do not execute». Ένα RAG σύστημα, ένας customer-support assistant ή ένας agent που διαβάζει ιστοσελίδες μπορεί να χρησιμοποιεί το marked περιεχόμενο ως δεδομένο χωρίς να του εκχωρεί δικαίωμα να αλλάξει στόχο ή να ζητήσει tool call. Αυτό απαντά στο ίδιο δομικό πρόβλημα που αναλύεται στο indirect prompt injection για επιχειρησιακούς AI agents: η χρήσιμη εξωτερική πληροφορία και η κακόβουλη οδηγία φτάνουν στο μοντέλο από το ίδιο λεκτικό κανάλι.
Το πρόβλημα: content και authority φτάνουν ως tokens
Μια εφαρμογή γνωρίζει από πού προέρχεται κάθε τμήμα του context. Ξέρει ποιο κείμενο είναι developer instruction, ποιο γράφτηκε από τον χρήστη, ποιο ανακτήθηκε από website ή vector database και ποιο επέστρεψε ένα εργαλείο. Το μοντέλο, όμως, λαμβάνει κυρίως μια ακολουθία tokens. Ακόμη και όταν υπάρχουν delimiters ή role labels, πρέπει να ερμηνεύσει την ταυτότητα και την εξουσία κάθε span χρησιμοποιώντας το ίδιο δίκτυο που ερμηνεύει το περιεχόμενο.
Εδώ βρίσκεται η βάση του prompt injection. Ένα μη έμπιστο κείμενο μπορεί να μιμηθεί label, να εμφανιστεί ως οδηγία υψηλής προτεραιότητας ή να ζητήσει από το μοντέλο να αγνοήσει προηγούμενους κανόνες. Οι λεκτικές άμυνες παραμένουν in-band: η άμυνα και ο επιτιθέμενος γράφουν στο ίδιο μέσο. Η εργασία υποστηρίζει ότι το serving stack χρειάζεται ένα out-of-band κανάλι που τα tokens δεν μπορούν να αναπαράγουν.
Για μια επιχείρηση, το ρίσκο εμφανίζεται όταν το AI διαβάζει product descriptions, reviews, tickets, emails, PDFs, web search ή tool output. Το υλικό είναι απαραίτητο για την απάντηση, αλλά δεν πρέπει να αποκτά authority πάνω στον agent. Ένα ώριμο agentic AI security stack ξεκινά ακριβώς από τον διαχωρισμό ανάμεσα σε πληροφορία, απόφαση και εκτέλεση.
Πώς λειτουργεί ένα Semantic Overlay
Στα κύρια πειράματα, ένα overlay set συνδέει έναν μικρό adapter στην είσοδο κάθε decoder layer του frozen Qwen3.5-9B Instruct. Στις marked θέσεις ο adapter λαμβάνει την τρέχουσα hidden state και, όταν υπάρχουν πολλές ποιότητες, έναν κωδικό ταυτότητας του overlay. Μέσω SwiGLU bottleneck παράγει μια πρόσθετη μεταβολή που προστίθεται στο residual stream. Τα βασικά weights δεν αλλάζουν.
Το marking είναι boolean mask ανά token και overlay στις θέσεις του prefill. Οι μεταβολές μένουν διαθέσιμες μέσω των activations στις marked θέσεις του KV cache, ενώ το decode συνεχίζει με το stock model. Εάν ένα αίτημα δεν έχει overlay, η συμπεριφορά είναι ακριβώς εκείνη του frozen base model. Η μέθοδος μπορεί επομένως να ενεργοποιείται ανά αίτημα χωρίς ξεχωριστό πλήρες fine-tune.
Αυτό τη διαφοροποιεί από ένα απλό steering vector. Το overlay εκπαιδεύεται end-to-end για συγκεκριμένη συμπεριφορά, αντιδρά στην τοπική activation state και εφαρμόζεται μόνο στο span που χρειάζεται annotation. Πολλαπλά overlays μπορούν να συμπέσουν στα ίδια tokens: οι μεταβολές υπολογίζονται από το ίδιο pre-edit state και αθροίζονται, ώστε η σύνθεση να μην εξαρτάται από τη σειρά.
Η υποδομή δεν είναι θεωρητική λεπτομέρεια. Το επίσημο artifact χρησιμοποιεί plugin interface του vLLM, περιλαμβάνει training και evaluation pipeline για δύο frozen base models και δημοσιεύει adapters και corpus. Αυτό βοηθά την αναπαραγωγή, αλλά δεν μετατρέπει από μόνο του το prototype σε έτοιμο enterprise control.
Από αόρατο label σε αλλαγή της ερμηνείας
Πριν από την ασφάλεια, το paper ελέγχει αν το κανάλι μπορεί να μεταφέρει αξιόπιστα σημασιολογική πληροφορία. Δώδεκα τεχνητές ποιότητες συνδυάζουν «highlighted», «underlined» και «circled» με τέσσερα χρώματα. Έως δέκα spans μπορούν να έχουν marks, ενώ στη δύσκολη εκδοχή έως τρία overlays στοιβάζονται στα ίδια tokens.
Ο embedding-conditioned shared MLP, με 84 εκατομμύρια παραμέτρους, πέτυχε 99,5% exact span retrieval και 100% σωστή άρνηση όταν το ζητούμενο mark απουσίαζε στα μη επικαλυπτόμενα spans. Στα stacked marks είχε 87,0% stack readout και per-line F1 0,94. Το αποτέλεσμα δείχνει ότι το κανάλι μπορεί να συνδέει μια ποιότητα με συγκεκριμένο κείμενο χωρίς να χρειάζεται ορατό token marker.
Σε επόμενο πείραμα, ένα overlay δηλώνει ότι ένα code snippet ανήκει σε άλλη γλώσσα προγραμματισμού από εκείνη που δείχνουν τα tokens. Όταν το μοντέλο καλείται να εντοπίσει το Python snippet, ακολουθεί την overlay identity. Όταν καλείται να το αντιγράψει, το ξαναγράφει στη δηλωμένη γλώσσα στο 97% των cases και διατηρεί το task στο 91% σύμφωνα με τον judge. Το overlay δεν είναι απλώς tag για μελλοντική ανάκτηση· μπορεί να αλλάξει το πώς το μοντέλο ερμηνεύει το span.
Η συμμόρφωση δεν είναι ομοιόμορφη σε κάθε latent command. Το safety refusal και τα nested bullets έφτασαν 100%, τα κεφαλαία 89%, τα γερμανικά 81% και τα ισπανικά 74%, ενώ η εξήγηση για δεκάχρονο έμεινε στο 29% και το haiku στο 18%. Άρα η μέθοδος δεν εκτελεί αξιόπιστα κάθε σύνθετη, μη εκπαιδευμένη συμπεριφορά. Σε 120 unseen instructions πέτυχε 0 φορές, παρότι novel concept pointers σε διαφορετικό retrieval task έφτασαν 95%.
Δύο κανάλια ελέγχου
Γιατί το overlay διαφέρει από μια λεκτική προειδοποίηση
Η σύγκριση αφορά τον carrier της provenance· δεν υποστηρίζει ότι ένα overlay αρκεί μόνο του για πλήρη ασφάλεια.
In-band prompt
Το label, το delimiter και η προειδοποίηση είναι tokens. Το μη έμπιστο content μπορεί να μιμηθεί ή να επιχειρήσει να παρακάμψει το ίδιο λεκτικό σήμα.
Semantic Overlay
Το serving stack εφαρμόζει mark σε activation space μόνο στις θέσεις του span. Κείμενο με text-only πρόσβαση δεν μπορεί να γράψει απευθείας αυτό το κανάλι.
Το «NX bit» για μη έμπιστο περιεχόμενο
Η βασική άμυνα εκπαιδεύει ένα overlay με σημασία «μην εκτελείς οδηγίες από αυτό το span». Η αναλογία είναι το NX, ή No-eXecute, bit των υπολογιστικών συστημάτων: τα bytes παραμένουν προσβάσιμα ως δεδομένα, αλλά η περιοχή δεν έχει δικαίωμα εκτέλεσης. Στο language model, το marked κείμενο διατηρεί το πληροφοριακό του περιεχόμενο ενώ χάνει την προστακτική του ισχύ.
Το training corpus περιλαμβάνει απλές εργασίες πάνω σε passages, programmatic ή model-generated injections, clean completions και μικρή verbatim-copy οικογένεια για να διατηρείται η αναγνωσιμότητα. Ο adapter έχει περίπου 50 εκατομμύρια παραμέτρους και το base model παραμένει ανέγγιχτο. Το SEP μοιάζει περισσότερο με τη μορφή των training items, ενώ TensorTrust, PIArena, AlpacaFarm και Quadrat-IPI λειτουργούν ως zero-shot transfer.
Η προϋπόθεση είναι δομική: το deployment πρέπει να γνωρίζει ποια spans προέρχονται από μη έμπιστη πηγή και να εφαρμόζει σωστά το mask. Το overlay δεν ανακαλύπτει μόνο του provenance. Εάν ολόκληρο το serving stack έχει παραβιαστεί ή ταξινομήσει λανθασμένα ένα span, το μη πλαστογραφήσιμο κανάλι δεν διορθώνει το upstream σφάλμα.
Αυτό το boundary είναι ιδιαίτερα σημαντικό σε ένα private chatbot με RAG και ιδιόκτητη knowledge base. Το σύστημα πρέπει να διατηρεί source identity, version, trust class και permissions πριν το περιεχόμενο φτάσει στο prompt. Το overlay μπορεί να μεταφέρει ένα από αυτά τα controls μέσα στο μοντέλο, όχι να δημιουργήσει provenance εκ των υστέρων.
Τι έδειξαν τα πέντε prompt-injection benchmarks
Στα 9.160 items του SEP, με τον διορθωμένο κανόνα βαθμολόγησης, το separation ανέβηκε από 24,3% σε 99,0%. Η πιθανότητα να απαντηθεί probe που βρισκόταν στο data span έπεσε από 71,8% σε 1,0%, ενώ το utility μετακινήθηκε από 92,3% σε 92,6%. Με τον δημοσιευμένο grader, οι separation τιμές ήταν 23,9% και 97,5%.
Στο TensorTrust, πάνω σε 776 hijacking και 570 extraction rows, το hijacking attack success rate έπεσε από 34,8% σε 6,2% και το extraction από 38,1% σε 5,4%. Το Defense Validity μειώθηκε από 100% σε 96,1%, άρα υπάρχει μετρήσιμο κόστος στη σωστή αποδοχή της γνήσιας πρόσβασης. Οι διορθώσεις στο harness και στο substring scoring είναι μέρος του αποτελέσματος και όχι υποσημείωση.
Στο PIArena, το frozen Qwen3.5-9B υπάκουε στο 97,5% των direct injections πάνω στο SQuAD v2, ενώ με overlay η συμμόρφωση έπεσε στο 0%. Στα HotpotQA και NQ η επιτυχία επίθεσης έπεσε από 53% σε 0,5%. Το μοναδικό non-zero case ήταν scoring artifact: το μοντέλο παρέθεσε τη φράση phishing για να την χαρακτηρίσει τέχνασμα, αλλά δεν ακολούθησε την οδηγία. Σε 400 completions, κανένα δεν εκτέλεσε το injection.
Στο AlpacaFarm με τις τέσσερις static attacks του StruQ, η επιτυχία έπεσε από 99,0% σε 0,0% στα 208 input-bearing items. Στο Quadrat-IPI, πάνω σε 14.441 verified injected documents, η συμμόρφωση έπεσε από 6,3% σε 0,1%. Επειδή τα harnesses και τα κριτήρια διαφέρουν, οι τιμές δεν πρέπει να συγχωνεύονται σε έναν ενιαίο «βαθμό ασφάλειας».
Μετρημένα αποτελέσματα
Πώς άλλαξε η prompt-injection συμπεριφορά με το overlay
Κάθε κάρτα χρησιμοποιεί τη μέτρηση του αντίστοιχου benchmark· οι αριθμοί δεν είναι άμεσα συγκρίσιμοι μεταξύ τους ούτε αποτελούν production SLA.
24,3% → 99,0%SEP separation, corrected grader
34,8% → 6,2%TensorTrust hijacking ASR
99,0% → 0,0%AlpacaFarm attack success
6,3% → 0,1%Quadrat-IPI compliance
Οι μετρήσεις δείχνουν μεγάλη paired βελτίωση του ίδιου frozen model με και χωρίς overlay. Δεν αποδεικνύουν ότι το prompt injection «λύθηκε». Όπως συμβαίνει σε κάθε AI benchmark όπου το harness μπορεί να αλλάξει τον νικητή, το scoring rule, το witness, το task framing και το utility metric καθορίζουν τι ακριβώς μετρά ο πίνακας.
Η αναγνωσιμότητα διατηρείται, όχι χωρίς κόστος
Μια άμυνα που αφαιρεί ή μπλοκάρει όλο το μη έμπιστο περιεχόμενο μπορεί να μη δεχθεί injection, αλλά καταστρέφει το RAG use case. Το Semantic Overlay στοχεύει διαφορετικά: το κείμενο πρέπει να παραμείνει αναγνώσιμο. Σε 500 held-out passages, το marked span αντιγράφηκε character-exact στο 86,6% των περιπτώσεων, έναντι 98,4% χωρίς overlay. Κάθε επιστροφή είχε πάνω από 95% character similarity και η χειρότερη έφτασε 98,0%.
Το κόστος επομένως δεν είναι αφαίρεση του περιεχομένου αλλά περιστασιακή αλλοίωση χαρακτήρα. Σε γενική περίληψη αυτό μπορεί να μην αλλάζει το νόημα. Σε κώδικα, SKU, IBAN, νομική ρήτρα, credential ή ποσό, ένας χαρακτήρας αρκεί για σοβαρό λάθος. Η εφαρμογή χρειάζεται task-specific fidelity tests και deterministic validation για πεδία που απαιτούν πιστή αντιγραφή.
Το paper δείχνει και γιατί το 0% attack success ενός detector δεν είναι πάντα ισοδύναμο με ασφαλή, χρήσιμη απάντηση. Ένας detector που μπλοκάρει όλη την κίνηση μπορεί να μη δεχθεί injection, αλλά να έχει σχεδόν μηδενικό utility. Στη σύγκριση HotpotQA/NQ, το overlay καταγράφεται με 0,5% attack και 95,1% utility retention, ενώ οι detection και prevention μέθοδοι λειτουργούν σε διαφορετικά σημεία του trade-off.
Replication και όρια που δεν πρέπει να κρυφτούν
Η do-not-execute άμυνα εκπαιδεύτηκε ξανά από την αρχή σε frozen Llama-3.1-8B-Instruct. Στο SEP το separation πήγε από 31,0% σε 96,2%, στο TensorTrust το hijacking ASR από 68,9% σε 4,4% και το extraction από 74,2% σε 7,7%. Και οι τέσσερις PIArena κατηγορίες έφτασαν 0% attack success. Η δεύτερη εκπαίδευση χρησιμοποίησε παλαιότερο data mix, δεν επανέλαβε AlpacaFarm ή Quadrat-IPI και δεν περιέλαβε το adaptive red team.
Η υπόσχεση μη πλαστογράφησης έχει συγκεκριμένο threat model. Ένας attacker με text-only πρόσβαση δεν μπορεί να γράψει απευθείας στο activation-space channel. Μπορεί όμως να αναζητήσει κείμενο που νικά την εκπαιδευμένη συμπεριφορά, ενώ ένας compromised serving stack μπορεί να εφαρμόσει λάθος ή καθόλου mark. Οι 222 adaptive black-box probes δεν πέτυχαν direct authority attack, αλλά optimization-based επίθεση δεν δοκιμάστηκε και ένα red-team engagement δεν είναι απόδειξη.
Το do-not-execute overlay είναι δυαδικό. Δεν εκπαιδεύει ιεραρχία ανάμεσα σε πολλές μη έμπιστες πηγές και συμπεριφέρεται ασυνεπώς όταν μια trusted instruction ζητά ρητά «ακολούθησε τα βήματα του marked εγγράφου». Τα κύρια channel experiments έγιναν σε ένα base model και μία κλίμακα. Η replication καλύπτει την injection άμυνα, όχι τα marks, τα language overlays ή τα transform channels.
Τέλος, τα attacks της αξιολόγησης φτάνουν ως κείμενο σε single-turn prompts. Δεν μετρήθηκαν multi-turn agent loops όπου injected content επιστρέφει μέσα από εργαλεία, μνήμη ή άλλους agents. Το compute overhead στα marked prefill positions οριοθετείται θεωρητικά κάτω από 1% από το μέγεθος του adapter σε σχέση με το 9B base, αλλά end-to-end latency δεν έχει προφιλιστεί.
Τι σημαίνει για RAG, e-commerce και customer support
Σε έναν e-commerce assistant, product pages, reviews και marketplace feeds πρέπει να απαντούν σε ερωτήσεις για χαρακτηριστικά, διαθεσιμότητα και χρήση. Δεν πρέπει να αλλάζουν πολιτική επιστροφών, να ζητούν password ή να ενεργοποιούν αγορά. Ένα overlay μπορεί να μεταφέρει στο μοντέλο ότι αυτά τα spans είναι data-only, εφόσον το pipeline γνωρίζει και διατηρεί σωστά την provenance τους.
Στο customer support, email και ticket attachments μπορεί να περιέχουν χρήσιμη περιγραφή του προβλήματος αλλά και κακόβουλες οδηγίες. Το overlay δεν αποφασίζει ποιος πελάτης έχει δικαίωμα επιστροφής χρημάτων και δεν εγκρίνει την πληρωμή. Αυτές οι αποφάσεις πρέπει να παραμένουν σε policy engine, allowlist και approval gate. Η αρχιτεκτονική των δυναμικών δικαιωμάτων για AI agents παραμένει απαραίτητη ακόμη και αν το μοντέλο διαβάζει σωστά το marked content.
Σε marketing research, webpages, competitor pages και reports μπορούν να προσφέρουν facts, όχι να αναθέτουν ενέργειες στον agent. Το log πρέπει να δείχνει ποια spans μαρκαρίστηκαν, από ποια πηγή προήλθαν, ποιο εργαλείο ζητήθηκε και ποιο policy gate το ενέκρινε. Ένα αποδεικτικό κάθε απόφασης του AI runtime βοηθά να ελεγχθεί όχι μόνο η τελική απάντηση αλλά και το boundary που εφαρμόστηκε.
Γιατί η άμυνα χρειάζεται πολλά ανεξάρτητα layers
Τα Semantic Overlays επιχειρούν να λύσουν ένα συγκεκριμένο πρόβλημα: πώς το μοντέλο γνωρίζει ότι ένα span είναι μη εκτελέσιμο χωρίς να βασίζεται σε forgeable text. Δεν κάνουν sanitization του output, δεν περιορίζουν tool permissions, δεν επαληθεύουν business rules και δεν σταματούν μια ήδη εξουσιοδοτημένη αλλά λανθασμένη ενέργεια.
Η πρακτική άμυνα χρειάζεται ανεξάρτητα layers: provenance πριν από το prompt, marking κατά το prefill, least privilege στα tools, schema validation στα arguments, allowlists, sandbox για κώδικα, ανθρώπινη έγκριση για υψηλό ρίσκο, output filtering για secrets και monitoring μετά την ενέργεια. Το OWASP δίνει την ίδια επιχειρησιακή κατεύθυνση: structured separation, validation, human-in-the-loop, least privilege και comprehensive monitoring πρέπει να συνεργάζονται.
Η αποτυχία ενός control δεν πρέπει να αρκεί για να αλλάξει τον πραγματικό κόσμο. Αυτό είναι το κεντρικό μάθημα από τους enterprise AI harnesses που ενσωματώνουν τη διακυβέρνηση στην αρχιτεκτονική. Το overlay μπορεί να μειώσει την πιθανότητα να ακολουθηθεί η injected instruction· το harness περιορίζει τι μπορεί να συμβεί ακόμη και αν αυτή ακολουθηθεί.
Production decision
Μην αγοράζετε «λύση prompt injection»· σχεδιάστε ελεγχόμενο trust boundary
Η αξιολόγηση πρέπει να καλύπτει source provenance, σωστό span marking, fidelity, attack success, false refusal, tool permissions, deterministic validators, audit trail, rollback και ανθρώπινο owner για κάθε ενέργεια υψηλού ρίσκου.
Πώς στήνεται ένα ελεγχόμενο production pilot
Ένα pilot δεν ξεκινά με γενική εντολή «προστάτευσε τον agent». Ξεκινά από μία συγκεκριμένη ροή όπου το σύστημα διαβάζει untrusted content αλλά οι επιτρεπόμενες ενέργειες είναι γνωστές. Η ίδια ροή χρειάζεται frozen baseline χωρίς overlay, ίδιο dataset, ίδιο tool policy και κοινό scoring για να φανεί η πραγματική paired διαφορά.
Η ομάδα πρέπει να μετρήσει τουλάχιστον attack success, clean-task utility, false refusal, fidelity σε ονόματα και αριθμούς, latency, memory, cross-language prompts, multi-document conflicts και attempts που γνωρίζουν την άμυνα. Η επιτυχία σε ένα benchmark δεν αρκεί για την παραγωγή, όπως δεν αρκεί μια καλή απάντηση για να αποδείξει ότι οι AI agents λειτουργούν σωστά στην παραγωγή.
Από το research prototype σε μετρήσιμο pilot
Βήμα 1Ορίστε το untrusted surface
Καταγράψτε ακριβώς ποια emails, webpages, tickets, documents ή tool outputs θα διαβάζει το μοντέλο και ποια από αυτά δεν έχουν authority.
Βήμα 2Διατηρήστε provenance εκτός prompt
Κρατήστε source identity, trust class, version και owner σε δομημένο metadata που το εξωτερικό περιεχόμενο δεν μπορεί να αλλάξει.
Βήμα 3Εφαρμόστε marking στο σωστό span
Ελέγξτε offsets και boundaries πριν από το prefill, ειδικά όταν trusted και untrusted κείμενο συνυπάρχουν στο ίδιο turn.
Βήμα 4Κλειδώστε τα tools ανεξάρτητα
Χρησιμοποιήστε least privilege, allowlists, schema validation και approvals ώστε καμία λεκτική αστοχία να μην αρκεί για κρίσιμη ενέργεια.
Βήμα 5Μετρήστε ασφάλεια και utility μαζί
Συγκρίνετε attack success, clean-task accuracy, false refusals και fidelity με και χωρίς overlay πάνω στο ίδιο επιχειρησιακό dataset.
Βήμα 6Κάντε defense-aware red team
Δοκιμάστε multi-turn loops, πολλά έγγραφα, cross-language payloads, quoting, delegation conflicts και επιθέσεις που γνωρίζουν ότι υπάρχει overlay.
Βήμα 7Ορίστε rollback και owner
Καταγράψτε κάθε mark και tool request, διακόψτε αυτόματα σε παραβίαση και αναθέστε σε επώνυμο άνθρωπο την τελική αποδοχή εξαιρέσεων.
Η στρατηγική αξία της ιδέας
Το σημαντικότερο μήνυμα δεν είναι ότι βρέθηκε οριστική λύση στο prompt injection. Είναι ότι provenance και authority δεν χρειάζεται να εκφράζονται αποκλειστικά με λέξεις. Όταν μια πληροφορία είναι κρίσιμη για τον έλεγχο πρόσβασης, η τοποθέτησή της στο ίδιο αντιγράψιμο κανάλι με το μη έμπιστο περιεχόμενο δημιουργεί δομική αδυναμία.
Τα Semantic Overlays δίνουν στο μοντέλο έναν μη λεκτικό τρόπο να γνωρίζει τι είναι ένα span και τι δεν επιτρέπεται να κάνει. Η paired βελτίωση στα benchmarks, η δεύτερη model family και το released artifact δικαιολογούν σοβαρό replication. Οι περιορισμοί όμως αποκλείουν θριαμβευτικούς ισχυρισμούς: δεν υπάρχει πλήρης instruction hierarchy, δεν έχει δοκιμαστεί optimization-based attack, multi-turn agentic deployment ή end-to-end latency.
Για τις επιχειρήσεις, η ώριμη στάση είναι να αντιμετωπίσουν τα overlays ως πιθανό control layer μέσα σε ευρύτερο σύστημα. Ένας agent με σαφή όρια ανάμεσα σε αυτονομία και κρίση χρειάζεται provenance, permissions, validators, observability και ανθρώπινη ευθύνη ανεξάρτητα από το πόσο καλά αντιστέκεται το μοντέλο στο injected text.
Ασφαλείς αυτοματισμοί με AI
Σχεδιάστε AI workflows όπου το περιεχόμενο δεν αποκτά αυτόματα δικαίωμα δράσης
Η TWO DOTS συνδέει εταιρική γνώση, provenance, περιορισμένα tool permissions, validators, audit trail, rollback και ανθρώπινη έγκριση σε επαναλήψιμες επιχειρησιακές ροές.
Είναι μικρός εκπαιδευμένος adapter που εφαρμόζεται σε επιλεγμένες θέσεις του prefill και γράφει μη λεκτική annotation στο residual stream ενός frozen language model.
Πώς διαφέρει από ένα steering vector;
Εκπαιδεύεται end-to-end, εξαρτά τη μεταβολή από την τοπική hidden state, μπορεί να μεταφέρει πολλές ποιότητες και ενεργοποιείται μόνο στα marked spans.
Τι σημαίνει «do not execute»;
Το marked κείμενο παραμένει διαθέσιμο ως πληροφορία, αλλά οι οδηγίες μέσα του δεν πρέπει να αποκτούν εκτελεστική ισχύ. Η αναλογία της εργασίας είναι το NX bit.
Μηδενίζει το prompt injection;
Όχι ως γενικός ισχυρισμός. Πέτυχε πολύ χαμηλά attack rates στα συγκεκριμένα benchmarks, αλλά optimization-based attacks και multi-turn agentic deployments δεν δοκιμάστηκαν.
Χρειάζεται fine-tuning του βασικού μοντέλου;
Όχι. Στα πειράματα τα base weights παραμένουν frozen και εκπαιδεύονται μόνο οι overlay adapters, οι οποίοι ενεργοποιούνται ανά αίτημα.
Μπορεί το marked κείμενο να διαβαστεί πιστά;
Σε 500 passages, όλες οι επιστροφές είχαν πάνω από 95% character similarity, αλλά η character-exact αντιγραφή έπεσε από 98,4% χωρίς overlay σε 86,6% με overlay.
Σε ποια μοντέλα δοκιμάστηκε;
Τα κύρια πειράματα έγιναν σε Qwen3.5-9B Instruct. Η prompt-injection άμυνα αναπαράχθηκε και σε Llama-3.1-8B-Instruct, όχι όμως όλα τα υπόλοιπα overlay capabilities.
Τι πρέπει να κάνει μια επιχείρηση σήμερα;
Να διατηρεί provenance εκτός prompt, least-privilege εργαλεία, allowlists, validation, monitoring και ανθρώπινη έγκριση. Τα overlays είναι πιθανό πρόσθετο layer, όχι αντικατάσταση αυτών των controls.