AI governance

Δύο ρομποτικοί AI agents συντονίζονται μέσω κοινής σύνδεσης σε βιομηχανικό εργαστήριο

Τα AI agents «μιλούν» πραγματικά; Τι αποκαλύπτει ο αιτιακός έλεγχος των latent μηνυμάτων

Η latent επικοινωνία AI agents χρειάζεται αιτιακό έλεγχο, όχι μόνο accuracy. Δείτε τι αποκαλύπτουν τα CAG, SSG και οι ελεγχόμενες αντικαταστάσεις.

ΠερισσότεραΤα AI agents «μιλούν» πραγματικά; Τι αποκαλύπτει ο αιτιακός έλεγχος των latent μηνυμάτων
Ασφάλεια LLM μετά το fine-tuning σε περιβάλλον πολλαπλών prompt templates

Ασφάλεια LLM μετά το fine-tuning: γιατί το prompt template μπορεί να ακυρώσει την άμυνα

Η ασφάλεια LLM μετά το fine-tuning απαιτεί cross-template tests. Δείτε πώς το ROPD μειώνει το ASR χωρίς να θυσιάζει την εξειδικευμένη ικανότητα.

ΠερισσότεραΑσφάλεια LLM μετά το fine-tuning: γιατί το prompt template μπορεί να ακυρώσει την άμυνα
Ομάδα ελέγχει δεδομένα εκπαίδευσης AI για ιχνηλασιμότητα με FrED και knowledge graphs

FrED: πώς τα knowledge graphs φωτίζουν τα δεδομένα πίσω από ένα AI

Το FrED συνδυάζει latent similarity και knowledge graphs για black-box Training Data Attribution. Τι έδειξαν τα πειράματα, πού σταματά η απόδειξη και πώς μπορεί να αξιολογηθεί επιχειρηματικά.

ΠερισσότεραFrED: πώς τα knowledge graphs φωτίζουν τα δεδομένα πίσω από ένα AI
Ομάδα ελέγχει Incomplete Prompt Jailbreaks και ασφάλεια LLM

Incomplete Prompt Jailbreaks: γιατί η μισή πρόταση μπορεί να παρακάμψει την ασφάλεια ενός LLM

Τα Incomplete Prompt Jailbreaks δείχνουν γιατί ένα LLM μπορεί να συνεχίσει επιβλαβές κείμενο πριν αρνηθεί και τι αλλάζει στο testing ασφάλειας.

ΠερισσότεραIncomplete Prompt Jailbreaks: γιατί η μισή πρόταση μπορεί να παρακάμψει την ασφάλεια ενός LLM
Παρασυνεπής απαγωγή σε επιχειρησιακό AI workflow με δύο αντικρουόμενες ομάδες στοιχείων

Παρασυνεπής απαγωγή: πώς η AI εξετάζει αντιφατικές εξηγήσεις χωρίς να καταρρέει

Η παρασυνεπής απαγωγή δείχνει πώς ένα AI σύστημα μπορεί να εξετάζει αντικρουόμενες εξηγήσεις χωρίς αυθαίρετα συμπεράσματα. Τι σημαίνει για agents, εταιρικά δεδομένα και ασφαλείς αυτοματισμούς.

ΠερισσότεραΠαρασυνεπής απαγωγή: πώς η AI εξετάζει αντιφατικές εξηγήσεις χωρίς να καταρρέει
Ομάδα αξιολογεί υποδομή για Inkling open-weight AI σε επιχειρησιακή εγκατάσταση

Inkling: τι αλλάζει το αμερικανικό open-weight AI για τις επιχειρήσεις

Το Inkling φέρνει open-weight AI για επιχειρήσεις, με multimodal δυνατότητες και fine-tuning, αλλά απαιτεί αυστηρό έλεγχο κόστους, υποδομής και ρίσκου.

ΠερισσότεραInkling: τι αλλάζει το αμερικανικό open-weight AI για τις επιχειρήσεις
Ανεξάρτητος έλεγχος AI agent με διαχωρισμό ρόλων και ανθρώπινη εποπτεία

Όταν το AI πείθει τον ελεγκτή του: το κρυφό ρίσκο του Chain-of-Thought monitoring

Νέα έρευνα δείχνει πώς ένας AI agent μπορεί να πείσει τον monitor του και γιατί το ασφαλές CoT monitoring απαιτεί ανεξάρτητο fact-checking και κανόνες.

ΠερισσότεραΌταν το AI πείθει τον ελεγκτή του: το κρυφό ρίσκο του Chain-of-Thought monitoring
Ομάδα αξιολόγησης AI benchmarks σε σύγχρονο computing lab

Every Eval Ever: γιατί τα AI benchmarks χρειάζονται διαφάνεια πριν τα εμπιστευτείς

Τα AI benchmarks χρειάζονται context για μοντέλο, dataset, prompts και settings. Δείτε πώς το Every Eval Ever κάνει τα scores ελέγξιμα για επιχειρήσεις.

ΠερισσότεραEvery Eval Ever: γιατί τα AI benchmarks χρειάζονται διαφάνεια πριν τα εμπιστευτείς