AI governance

Δύο ρομποτικοί AI agents συντονίζονται μέσω κοινής σύνδεσης σε βιομηχανικό εργαστήριο

Τα AI agents «μιλούν» πραγματικά; Τι αποκαλύπτει ο αιτιακός έλεγχος των latent μηνυμάτων

Η latent επικοινωνία AI agents χρειάζεται αιτιακό έλεγχο, όχι μόνο accuracy. Δείτε τι αποκαλύπτουν τα CAG, SSG και οι ελεγχόμενες αντικαταστάσεις.

Read MoreΤα AI agents «μιλούν» πραγματικά; Τι αποκαλύπτει ο αιτιακός έλεγχος των latent μηνυμάτων
Ασφάλεια LLM μετά το fine-tuning σε περιβάλλον πολλαπλών prompt templates

Ασφάλεια LLM μετά το fine-tuning: γιατί το prompt template μπορεί να ακυρώσει την άμυνα

Η ασφάλεια LLM μετά το fine-tuning απαιτεί cross-template tests. Δείτε πώς το ROPD μειώνει το ASR χωρίς να θυσιάζει την εξειδικευμένη ικανότητα.

Read MoreΑσφάλεια LLM μετά το fine-tuning: γιατί το prompt template μπορεί να ακυρώσει την άμυνα
Ομάδα ελέγχει δεδομένα εκπαίδευσης AI για ιχνηλασιμότητα με FrED και knowledge graphs

FrED: πώς τα knowledge graphs φωτίζουν τα δεδομένα πίσω από ένα AI

Το FrED συνδυάζει latent similarity και knowledge graphs για black-box Training Data Attribution. Τι έδειξαν τα πειράματα, πού σταματά η απόδειξη και πώς μπορεί να αξιολογηθεί επιχειρηματικά.

Read MoreFrED: πώς τα knowledge graphs φωτίζουν τα δεδομένα πίσω από ένα AI
Ομάδα ελέγχει Incomplete Prompt Jailbreaks και ασφάλεια LLM

Incomplete Prompt Jailbreaks: γιατί η μισή πρόταση μπορεί να παρακάμψει την ασφάλεια ενός LLM

Τα Incomplete Prompt Jailbreaks δείχνουν γιατί ένα LLM μπορεί να συνεχίσει επιβλαβές κείμενο πριν αρνηθεί και τι αλλάζει στο testing ασφάλειας.

Read MoreIncomplete Prompt Jailbreaks: γιατί η μισή πρόταση μπορεί να παρακάμψει την ασφάλεια ενός LLM
Παρασυνεπής απαγωγή σε επιχειρησιακό AI workflow με δύο αντικρουόμενες ομάδες στοιχείων

Παρασυνεπής απαγωγή: πώς η AI εξετάζει αντιφατικές εξηγήσεις χωρίς να καταρρέει

Η παρασυνεπής απαγωγή δείχνει πώς ένα AI σύστημα μπορεί να εξετάζει αντικρουόμενες εξηγήσεις χωρίς αυθαίρετα συμπεράσματα. Τι σημαίνει για agents, εταιρικά δεδομένα και ασφαλείς αυτοματισμούς.

Read MoreΠαρασυνεπής απαγωγή: πώς η AI εξετάζει αντιφατικές εξηγήσεις χωρίς να καταρρέει
Ανεξάρτητος έλεγχος AI agent με διαχωρισμό ρόλων και ανθρώπινη εποπτεία

Όταν το AI πείθει τον ελεγκτή του: το κρυφό ρίσκο του Chain-of-Thought monitoring

Νέα έρευνα δείχνει πώς ένας AI agent μπορεί να πείσει τον monitor του και γιατί το ασφαλές CoT monitoring απαιτεί ανεξάρτητο fact-checking και κανόνες.

Read MoreΌταν το AI πείθει τον ελεγκτή του: το κρυφό ρίσκο του Chain-of-Thought monitoring