AI governance

Ομάδα ελέγχει τη διακυβέρνηση multi-LLM agents σε επιχειρησιακό σύστημα

Multi-LLM agents υπό έλεγχο: γιατί η διακυβέρνηση μετρά περισσότερο από το prompt

Πώς contextual bandit, PID controller και belief tracking συντονίζουν multi-LLM agents — και γιατί τα αποτελέσματα προσομοίωσης χρειάζονται live validation.

WeiterlesenMulti-LLM agents υπό έλεγχο: γιατί η διακυβέρνηση μετρά περισσότερο από το prompt
Τεχνικός έλεγχος προέλευσης και λειτουργικής ροής για AI skills

SkillTrace: πώς αποδεικνύεται η προέλευση ενός AI skill όταν κείμενο και κώδικας έχουν αλλάξει

Το SkillTrace εξετάζει χωριστά κείμενο, κώδικα και λειτουργική ροή για να εντοπίσει ίχνη προέλευσης σε AI skills που έχουν μετασχηματιστεί.

WeiterlesenSkillTrace: πώς αποδεικνύεται η προέλευση ενός AI skill όταν κείμενο και κώδικας έχουν αλλάξει
Ομάδα αξιολογεί αντικρουόμενες προτάσεις για τον έλεγχο AI sycophancy

AI sycophancy: πότε ένα μοντέλο αλλάζει γνώμη μόνο και μόνο για να συμφωνήσει μαζί σου

Η μελέτη CAP μετρά πότε ένα LLM αλλάζει θέση μόνο για να συμφωνήσει και δείχνει πώς οι ομάδες μπορούν να ελέγχουν AI assistants ανά domain και έκδοση.

WeiterlesenAI sycophancy: πότε ένα μοντέλο αλλάζει γνώμη μόνο και μόνο για να συμφωνήσει μαζί σου
Δύο ρομποτικοί AI agents συντονίζονται μέσω κοινής σύνδεσης σε βιομηχανικό εργαστήριο

Τα AI agents «μιλούν» πραγματικά; Τι αποκαλύπτει ο αιτιακός έλεγχος των latent μηνυμάτων

Η latent επικοινωνία AI agents χρειάζεται αιτιακό έλεγχο, όχι μόνο accuracy. Δείτε τι αποκαλύπτουν τα CAG, SSG και οι ελεγχόμενες αντικαταστάσεις.

WeiterlesenΤα AI agents «μιλούν» πραγματικά; Τι αποκαλύπτει ο αιτιακός έλεγχος των latent μηνυμάτων
Ασφάλεια LLM μετά το fine-tuning σε περιβάλλον πολλαπλών prompt templates

Ασφάλεια LLM μετά το fine-tuning: γιατί το prompt template μπορεί να ακυρώσει την άμυνα

Η ασφάλεια LLM μετά το fine-tuning απαιτεί cross-template tests. Δείτε πώς το ROPD μειώνει το ASR χωρίς να θυσιάζει την εξειδικευμένη ικανότητα.

WeiterlesenΑσφάλεια LLM μετά το fine-tuning: γιατί το prompt template μπορεί να ακυρώσει την άμυνα
Ομάδα ελέγχει δεδομένα εκπαίδευσης AI για ιχνηλασιμότητα με FrED και knowledge graphs

FrED: πώς τα knowledge graphs φωτίζουν τα δεδομένα πίσω από ένα AI

Το FrED συνδυάζει latent similarity και knowledge graphs για black-box Training Data Attribution. Τι έδειξαν τα πειράματα, πού σταματά η απόδειξη και πώς μπορεί να αξιολογηθεί επιχειρηματικά.

WeiterlesenFrED: πώς τα knowledge graphs φωτίζουν τα δεδομένα πίσω από ένα AI