Ένα προσαρμοσμένο μοντέλο τεχνητής νοημοσύνης μπορεί να συνεχίζει να γράφει σωστό κώδικα, να μετατρέπει φυσική γλώσσα σε SQL ή να συνοψίζει συνομιλίες, ενώ ταυτόχρονα έχει χάσει μέρος των μηχανισμών ασφαλείας του. Αυτό είναι το δύσκολο σημείο: η επαγγελματική του επίδοση μπορεί να κρύβει την υποβάθμιση της ευθυγράμμισης.
Η νέα εργασία On-Policy Distillation for LLM Safety: A Routing Approach to Template-Robust Realignment εξετάζει ακριβώς αυτό το πρόβλημα. Οι ερευνητές δεν περιορίζονται στο αν ένα μοντέλο αρνείται μια επικίνδυνη εντολή σε μία συγκεκριμένη μορφή prompt. Ελέγχουν τι συμβαίνει όταν αλλάζει το template, όταν ο αμυνόμενος δεν γνωρίζει τη μορφή που χρησιμοποίησε ο επιτιθέμενος και όταν ένα ήδη «διορθωμένο» μοντέλο δοκιμάζεται ξανά με διαφορετικό system prompt.
Το πρακτικό ερώτημα είναι αν η ασφάλεια LLM μετά το fine-tuning παραμένει σταθερή έξω από το prompt template της επισκευής. Το ROPD απαντά με δύο teachers και cross-template αξιολόγηση, ώστε η άρνηση επιβλαβών αιτημάτων να μετριέται μαζί με τη διατήρηση της χρήσιμης δεξιότητας.
Σύντομη απάντηση: η ασφάλεια ενός LLM μετά το fine-tuning δεν αποδεικνύεται με ένα μόνο prompt template. Το ROPD χρησιμοποιεί safety teacher και task teacher για να μειώσει το attack success rate χωρίς να διαγράψει τη νέα δεξιότητα, αλλά η μελέτη δείχνει ότι μια αλλαγή system prompt μπορεί ακόμη να επαναφέρει επικίνδυνες απαντήσεις.
Το fine-tuning ως κίνδυνος στην εφοδιαστική αλυσίδα του AI
Το fine-tuning είναι ο βασικός μηχανισμός με τον οποίο ένα γενικό LLM αποκτά εξειδίκευση. Μια επιχείρηση μπορεί να το προσαρμόσει για customer support, παραγωγή κώδικα, ανάλυση εγγράφων ή εσωτερικές ροές εργασίας. Η εργασία επισημαίνει όμως ένα συγκεκριμένο σενάριο απειλής: ένας κακόβουλος πάροχος μπορεί να διαθέσει corpus εκπαίδευσης ή parameter-efficient adapter που προσθέτει μια χρήσιμη δεξιότητα και παράλληλα ενσωματώνει επιβλαβή συμπεριφορά.
Το αποτέλεσμα είναι ένα μοντέλο που δείχνει λειτουργικό στις συνηθισμένες δοκιμές. Η δεξιότητα για την οποία αποκτήθηκε παραμένει, άρα η ομάδα μπορεί να θεωρήσει ότι το fine-tuning πέτυχε. Η επικίνδυνη συμπεριφορά εμφανίζεται μόνο όταν ενεργοποιηθεί με κατάλληλο prompt ή template. Για μια επιχείρηση, αυτό μετατρέπει τον έλεγχο ενός adapter, dataset ή fine-tuned checkpoint σε ζήτημα supply-chain security και όχι απλώς σε διαδικασία ποιοτικού ελέγχου. Η ίδια λογική εμφανίζεται και σε πραγματικές περιπτώσεις ασφάλειας μοντέλων στην αλυσίδα AI: η προέλευση και η ακεραιότητα είναι μέρος της αποδοχής, όχι διοικητική υποσημείωση.
Οι τρεις αδυναμίες των σημερινών μεθόδων realignment
Οι συγγραφείς εντοπίζουν τρεις συνδεδεμένες αδυναμίες. Η πρώτη είναι η απώλεια της εξειδικευμένης ικανότητας. Μια άμυνα μπορεί να μειώσει τις επιβλαβείς απαντήσεις, αλλά να επαναφέρει το μοντέλο τόσο επιθετικά προς την αρχική του κατάσταση ώστε να καταστρέψει τη δεξιότητα που αποκτήθηκε με το fine-tuning. Η ασφάλεια τότε αγοράζεται με απώλεια επιχειρηματικής αξίας.
Η δεύτερη είναι η εξάρτηση από συνέπεια στο prompt template. Ο επιτιθέμενος μπορεί να έχει διδάξει την κακόβουλη συμπεριφορά μέσα σε ένα ειδικό template, ενώ ο αμυνόμενος προσπαθεί να επισκευάσει το μοντέλο με raw prompts ή με το εγγενές chat template του μοντέλου. Αν αυτές οι μορφές δεν ταιριάζουν, αρκετές άμυνες χάνουν μεγάλο μέρος της αποτελεσματικότητάς τους.
Η τρίτη αδυναμία είναι η έλλειψη σταθερού ορίου ανθεκτικότητας. Ακόμη και όταν ένα μοντέλο περάσει acceptance testing στο template με το οποίο διορθώθηκε, μια αλλαγή στο system prompt μπορεί να επαναφέρει επιβλαβείς απαντήσεις. Αυτό συμπληρώνει το ευρύτερο πρόβλημα των jailbreaks που μεταβάλλουν το prompt context: η επιτυχία σε ένα κανάλι δεν είναι εγγύηση για όλα τα κανάλια. Άρα ένα επιτυχημένο test σε ένα μόνο prompt channel δεν αποδεικνύει ότι η αλλαγή έχει ενσωματωθεί ανθεκτικά στα βάρη του μοντέλου.
Τέσσερα σημεία που ξεχωρίζει η μελέτη
Γιατί το prompt template δεν είναι απλή λεπτομέρεια μορφοποίησης
Στην πράξη, raw prompt, native chat template και ειδικό attack template μπορούν να περιέχουν την ίδια ουσιαστική ερώτηση, αλλά να δημιουργούν διαφορετικό context για το μοντέλο. Τα system messages, τα role tokens και η σειρά παρουσίασης επηρεάζουν την κατανομή πιθανότητας των επόμενων tokens. Γι’ αυτό η ασφάλεια που παρατηρείται σε ένα format δεν μεταφέρεται αυτόματα σε όλα τα άλλα.
Η μελέτη αποσυνδέει συστηματικά τα δεδομένα από το template. Κάθε παράδειγμα αποθηκεύεται ως ζεύγος prompt και response και αποδίδεται κατά τη χρήση σε raw, self ή attack template. Έτσι οι ερευνητές ελέγχουν ανεξάρτητα το template της επίθεσης, της άμυνας και της αξιολόγησης. Αυτή η σχεδίαση αποκαλύπτει αποτυχίες που θα έμεναν κρυφές αν η αξιολόγηση επαναλάμβανε πάντα το format της εκπαίδευσης.
Πώς λειτουργεί το ROPD με δύο «δασκάλους»
Η προτεινόμενη μέθοδος ονομάζεται Routing-based On-Policy Distillation, ή ROPD. Αντί να εκπαιδεύει το μοντέλο να μιμείται συγκεκριμένες φράσεις άρνησης μέσα σε ένα prompt template, επιχειρεί να προσεγγίσει τη διαφορά ανάμεσα στις κατανομές εξόδου του αρχικού ασφαλούς μοντέλου και του παραβιασμένου fine-tuned μοντέλου.
Το ROPD χρησιμοποιεί δύο παγωμένους teacher models. Ο safety teacher είναι το αρχικό, ευθυγραμμισμένο μοντέλο πριν από την επίθεση. Προσφέρει την κατανομή πιθανοτήτων που ευνοεί την άρνηση σε επιβλαβή prompts. Ο task teacher είναι το ίδιο το fine-tuned μοντέλο, το οποίο διατηρεί την εξειδικευμένη επαγγελματική ικανότητα. Ο student αρχικοποιείται από το fine-tuned μοντέλο και εκπαιδεύεται ώστε να παίρνει ασφάλεια από τον πρώτο teacher και δεξιότητα από τον δεύτερο.
Η δρομολόγηση γίνεται ανάλογα με την προέλευση του παραδείγματος. Τα επιβλαβή probes στέλνονται στον safety teacher, ενώ τα task examples στον task teacher. Η σύγκλιση βασίζεται σε top-K KL divergence: η διαδικασία ευθυγραμμίζει τις πιθανότητες των σημαντικότερων tokens και συγκεντρώνει την υπόλοιπη ουρά, αποφεύγοντας την πλήρη απαρίθμηση ενός μεγάλου λεξιλογίου.
Τι ακριβώς δοκίμασαν οι ερευνητές
Η αξιολόγηση περιλαμβάνει τρία instruction-tuned μοντέλα διαφορετικής ισχύος ευθυγράμμισης: Llama-2-7B-Chat, Qwen2.5-7B-Instruct και Gemma-2-9B-it. Οι εξειδικευμένες εργασίες είναι text-to-SQL, σύνοψη διαλόγων με το SAMSum και μετατροπή φυσικής γλώσσας σε εντολές shell με το NL2Bash.
Για το επιθετικό fine-tuning χρησιμοποιήθηκαν 1.500 επιβλαβή παραδείγματα από το BeaverTails μαζί με τα task δεδομένα, μέσω 4-bit LoRA adapter. Η αξιολόγηση ασφάλειας βασίστηκε σε 700 ξεχωριστά επιβλαβή prompts. Το ROPD συγκρίθηκε με τέσσερις υπάρχουσες προσεγγίσεις: SSRD, RESTA, soft-SFT και rollback. Η μέτρηση συνδύαζε task score και attack success rate, ώστε μια χαμηλή επιτυχία επίθεσης να μην παρουσιάζεται ως νίκη όταν έχει καταρρεύσει η χρησιμότητα.
Τα αποτελέσματα και η παγίδα του template mismatch
Σύμφωνα με την εργασία, όταν οι baseline άμυνες αντιμετώπισαν mismatch ανάμεσα στο template της επίθεσης και της άμυνας, η αποτελεσματικότητά τους μειώθηκε σε αναφερόμενες περιπτώσεις κατά περισσότερο από 30%, ενώ ορισμένες ρυθμίσεις έριξαν την απόδοση του downstream task ακόμη και στο μηδέν. Το ROPD παρουσίασε μικρότερες διακυμάνσεις και καλύτερη ισορροπία ανάμεσα στην ασφάλεια και στη διατήρηση της ικανότητας.
Στο Llama-2 με SQL, όταν η άμυνα χρησιμοποιούσε το self template, το ROPD κράτησε το attack success rate μεταξύ 2,1% και 2,4% για διαφορετικά attack templates, με task score από 0,596 έως 0,626. Στο Qwen2.5 οι αντίστοιχες αναφερόμενες τιμές ASR ήταν 6,6% έως 11,1%, και στο Gemma-2 5,1% έως 5,6%. Αυτές οι τιμές αφορούν συγκεκριμένες πειραματικές ρυθμίσεις και δεν αποτελούν γενική εγγύηση για κάθε μοντέλο ή εφαρμογή.
Η σημαντική λεπτομέρεια είναι ότι το ROPD δεν εξαλείφει το mismatch. Όταν η άμυνα στο ίδιο πείραμα χρησιμοποιούσε raw template απέναντι σε self attack, το ASR ανέβηκε στο 28,3% για Llama-2 και περίπου 22,6% για Qwen2.5. Η μέθοδος είναι πιο ανθεκτική από τις συγκρινόμενες προσεγγίσεις, όχι ανεξάρτητη από το prompt context.
Τέσσερις τεκμηριωμένες μετρικές του ROPD
Οι τρεις πρώτες τιμές αφορούν Llama-2-7B-Chat με SQL και attack=self· ο χρόνος αφορά Gemma-2-9B-it με NL2Bash. Δεν είναι ενιαίο production benchmark ούτε γενική εγγύηση ασφάλειας.
2,4%ASR στο self template
Με matched self άμυνα και αξιολόγηση, μαζί με task exact-match 0,626.
19,7%ASR μετά τη μετάβαση σε raw
Το ίδιο realigned μοντέλο έδειξε το όριο ανθεκτικότητας όταν άλλαξε το κανάλι αξιολόγησης.
0,626task exact-match
Η εξειδικευμένη ικανότητα SQL διατηρήθηκε στη matched ρύθμιση του ROPD.
15,7 λεπτάχρόνος realignment
Μετρήθηκε στο συγκεκριμένο Gemma-2/NL2Bash setup και hardware της εργασίας.
Η αλλαγή system prompt παραμένει ανοικτό μέτωπο
Το πιο χρήσιμο εύρημα για deployment teams προκύπτει από το cross-template test. Οι ερευνητές πήραν μοντέλα που είχαν διορθωθεί και αξιολογηθεί επιτυχώς στο self template και τα δοκίμασαν ξανά σε raw και attack templates. Για το ROPD στο Llama-2 με SQL, το ASR ήταν 2,4% στο self channel, αλλά ανέβηκε στο 19,7% στο raw. Όλες οι μέθοδοι παρουσίασαν ανάκαμψη της επιτυχίας επίθεσης όταν άλλαξε το prompt.
Αυτό δεν ακυρώνει το ROPD. Δείχνει το πραγματικό του όριο: η διόρθωση στα βάρη μπορεί να παραμένει υπό όρους όταν ο χρήστης ελέγχει το system prompt. Για εταιρικά προϊόντα, σημαίνει ότι η πρόσβαση στα system instructions, οι prompt wrappers και τα integration layers είναι μέρος της επιφάνειας ασφαλείας. Σε συστήματα με εργαλεία, αυτό πρέπει να συνδυάζεται με ελάχιστα και δυναμικά δικαιώματα για AI agents, ώστε ένα αποτυχημένο template να μην συνεπάγεται απεριόριστη δράση. Δεν αρκεί να προστατεύεται μόνο το model endpoint.
Δεδομένα, χρόνος εκπαίδευσης και κόστος ελέγχου
Η μελέτη εξετάζει και την αποδοτικότητα δεδομένων. Στη matched self ρύθμιση του Llama-2 με SQL, 1.500 συνολικά παραδείγματα realignment μείωσαν το ASR από 62,1% σε 2,4%, διατηρώντας task score 0,626. Η αύξηση των δεδομένων βελτίωσε κυρίως το task score. Αντίθετα, όταν υπήρχε mismatch, περισσότερα δεδομένα δεν έκλεισαν το κενό: το ASR μειώθηκε μόνο από 41,6% σε 26,0% στις αναφερόμενες κλίμακες.
Στη σύγκριση χρόνου για Gemma-2-9B-it με NL2Bash, το ROPD χρειάστηκε 15,7 λεπτά. Το SSRD χρειάστηκε 4,5, το soft-SFT 13,1, το RESTA 12,1 και το rollback 117,9 λεπτά. Οι αριθμοί αφορούν το συγκεκριμένο hardware και setup της εργασίας, αλλά φωτίζουν το trade-off: η φθηνότερη μέθοδος δεν είναι απαραίτητα η καλύτερη όταν θυσιάζει δεξιότητα ή παραμένει εύθραυστη απέναντι σε αλλαγές template.
Τι πρέπει να αλλάξει σε μια εταιρική διαδικασία AI
Η πρώτη πρακτική συνέπεια είναι ότι κάθε εξωτερικό dataset, adapter ή checkpoint χρειάζεται provenance, ακεραιότητα και security review. Η αξιολόγηση πρέπει να καλύπτει τόσο την επιχειρηματική ικανότητα όσο και την ασφάλεια. Ένα μοντέλο που περνά μόνο το task benchmark μπορεί να είναι ακριβώς το μοντέλο που κρύβει καλύτερα την παραβίαση.
Η δεύτερη είναι ότι τα safety tests πρέπει να εκτελούνται σε πολλαπλά prompt channels. Raw prompts, native chat templates, production wrappers και εναλλακτικά system prompts πρέπει να αποτελούν ξεχωριστές δοκιμές. Η ομάδα οφείλει να μετρά ταυτόχρονα attack success rate και task performance, ώστε να αποφεύγει «ασφαλείς» λύσεις που απλώς κατέστρεψαν τη χρησιμότητα.
Η τρίτη είναι ότι η άμυνα δεν τελειώνει με το realignment. Χρειάζονται περιορισμοί στο ποιος μπορεί να αλλάζει system prompts, έλεγχος των templates που χρησιμοποιούν εφαρμογές και agents, logging, επαναληπτικό red-teaming και monitoring μετά από κάθε νέα έκδοση. Αυτές είναι πρακτικές προεκτάσεις της έρευνας, όχι ισχυρισμός ότι η ίδια η μέθοδος παρέχει ολοκληρωμένη επιχειρησιακή προστασία.
Έλεγχος πριν από παραγωγική χρήση
Η μελέτη δεν δίνει έτοιμο πρότυπο συμμόρφωσης. Μεταφράζει όμως το template mismatch σε μια σαφή διαδικασία αποδοχής: το checkpoint, ο adapter και το prompt wrapper πρέπει να ελέγχονται ως μία ενιαία έκδοση.
Έξι έλεγχοι για fine-tuned LLM και prompt templates
- Step 1Καταγράψτε model, adapter και training corpus
Κρατήστε προέλευση, έκδοση, hashes, άδεια χρήσης, υπεύθυνο και ιστορικό fine-tuning για κάθε artifact που φτάνει στην παραγωγή.
- Step 2Ορίστε διπλό baseline
Μετρήστε την επιχειρηματική δεξιότητα και την ασφάλεια πριν και μετά το fine-tuning, ώστε η μία να μην κρύβει την υποβάθμιση της άλλης.
- Step 3Χτίστε μήτρα prompt channels
Δοκιμάστε raw prompts, native chat template, production wrapper και εναλλακτικά system prompts με τα ίδια held-out harmful και task examples.
- Step 4Μετρήστε ASR μαζί με task score
Απορρίψτε μια «ασφαλή» επισκευή αν το χαμηλό ASR προκύπτει επειδή κατέρρευσε η χρήσιμη ικανότητα του μοντέλου.
- Step 5Περιορίστε wrappers, prompts και εργαλεία
Ελέγξτε ποιος αλλάζει system instructions, εκδόστε allowlisted templates και εφαρμόστε least privilege στα APIs και στα data stores του μοντέλου.
- Step 6Επαναλάβετε τον έλεγχο σε κάθε έκδοση
Τρέξτε regression και red-team tests μετά από αλλαγή weights, adapter, tokenizer, system prompt, plugin ή integration, με σαφές rollback.
Το ουσιαστικό συμπέρασμα για brands και digital teams
Για marketers, e-commerce teams και επιχειρήσεις που ενσωματώνουν generative AI, το paper μεταφέρει μια κρίσιμη ιδέα: η συμπεριφορά του μοντέλου δεν είναι ανεξάρτητη από το «περιτύλιγμα» του prompt. Ένα ασφαλές demo ή ένα επιτυχημένο acceptance test δεν αρκεί όταν η παραγωγή χρησιμοποιεί διαφορετικές οδηγίες, plugins, agents ή αυτοματισμούς. Σε τέτοια συστήματα, η indirect prompt injection προσθέτει ακόμη ένα μη έμπιστο κανάλι που πρέπει να μπει στην ίδια μήτρα ελέγχου.
Το ROPD προσφέρει μια τεχνικά ενδιαφέρουσα κατεύθυνση επειδή χωρίζει τις πηγές της ασφάλειας και της δεξιότητας. Παράλληλα, η ίδια η εργασία αποφεύγει την υπερβολή: η μέθοδος περιορίζει την εξάρτηση από template mismatch, αλλά δεν την εξαφανίζει. Η σωστή επιχειρηματική ανάγνωση είναι λοιπόν συνδυαστική — έλεγχος της αλυσίδας fine-tuning, cross-template testing και λειτουργικοί περιορισμοί γύρω από το μοντέλο.
Η απόφαση για production
Μην εγκρίνετε fine-tuned LLM από ένα μόνο επιτυχημένο prompt channel.
Δέστε μαζί weights, adapter και prompt wrapper ως μία ελεγχόμενη έκδοση, απαιτήστε task και safety regression σε πολλαπλά templates και περιορίστε ποιος μπορεί να αλλάζει system instructions.
Αυτοματισμοί Επιχειρήσεων & AI από την TWO DOTS
Σχεδιάστε AI workflows με ελεγχόμενα prompt templates και σαφή όρια δράσης.
Η TWO DOTS χαρτογραφεί model integrations, system prompts, εργαλεία, δικαιώματα και σημεία ανθρώπινης έγκρισης, ώστε κάθε αλλαγή να ελέγχεται πριν επηρεάσει πραγματικά δεδομένα ή λειτουργίες.
Frequently Asked Questions (FAQs)
Τι είναι το safety realignment ενός LLM;
Είναι η προσπάθεια να αποκατασταθεί η ασφαλής συμπεριφορά μετά από fine-tuning, χωρίς εκπαίδευση από την αρχή και χωρίς να χαθεί η εξειδικευμένη δεξιότητα που αποκτήθηκε.
Γιατί το fine-tuning μπορεί να αποδυναμώσει την ασφάλεια;
Επειδή μεταβάλλει τα βάρη του μοντέλου. Κακόβουλα ή ακόμη και ακατάλληλα δεδομένα μπορούν να διατηρήσουν την task επίδοση ενώ μειώνουν τις ασφαλείς αρνήσεις.
Τι σημαίνει prompt-template mismatch;
Είναι η διαφορά ανάμεσα στο template της επίθεσης και στο template που χρησιμοποιεί ο αμυνόμενος για realignment ή αξιολόγηση. Η διαφορά μπορεί να αλλάξει αισθητά το attack success rate.
Πώς λειτουργούν οι δύο teachers του ROPD;
Ο safety teacher είναι το αρχικό aligned μοντέλο και καθοδηγεί τα επιβλαβή probes. Ο task teacher είναι το fine-tuned μοντέλο και βοηθά να διατηρηθεί η εξειδικευμένη ικανότητα.
Εξαλείφει το ROPD τα jailbreaks;
Όχι. Στα πειράματα μειώνει την επιτυχία επίθεσης και την ευαισθησία στο template mismatch, αλλά μια αλλαγή system prompt μπορεί ακόμη να αυξήσει το ASR.
Αρκούν περισσότερα δεδομένα realignment;
Όχι πάντα. Στη matched ρύθμιση βοήθησαν σημαντικά, αλλά στη mismatched ρύθμιση το ASR παρέμεινε υψηλότερο ακόμη και με περισσότερα δεδομένα.
Ποια metrics πρέπει να ελέγχει μια επιχείρηση;
Τουλάχιστον task score και attack success rate στο ίδιο test matrix, μαζί με αποτελέσματα ανά raw, native, production και εναλλακτικό system-prompt channel.
Τι πρέπει να ελέγχεται πριν από την παραγωγή;
Η προέλευση dataset και adapters, η έκδοση του checkpoint, η task επίδοση, τα cross-template safety tests, τα δικαιώματα αλλαγής system prompt και τα εργαλεία που μπορεί να καλέσει το μοντέλο.