AI Safety

Ανθρώπινη εποπτεία σε στόλο drones με agentic AI

Agentic AI και στόλοι drones: η αυτονομία χρειάζεται διακυβέρνηση

Τι δείχνουν τα έργα NAMUR και PERSIST για την ασφαλή χρήση agentic AI σε στόλους drones, από την ανθρώπινη έγκριση έως τα ελέγξιμα εργαλεία και την αξιολόγηση.

Read MoreAgentic AI και στόλοι drones: η αυτονομία χρειάζεται διακυβέρνηση
Ερευνητές ελέγχουν υποδομή για monitoring των activations σε LLMs

Μπορούν τα LLMs να κρύψουν τη σκέψη τους; Το benchmark που μετρά τον έλεγχο των activations

Το Activation Controllability Benchmark δείχνει ότι πολλά LLMs αλλάζουν το εσωτερικό τους σήμα με οδηγία, άρα το monitoring χρειάζεται layered safeguards.

Read MoreΜπορούν τα LLMs να κρύψουν τη σκέψη τους; Το benchmark που μετρά τον έλεγχο των activations
Μηχανικός ελέγχει κύκλωμα AI για ανεξάρτητη εποπτεία με OWMI

Μπορεί ένα AI να καταλάβει τι συμβαίνει μέσα του; Τι αποκαλύπτει το OWMI

Το OWMI δείχνει ότι η λεκτική αυτοαναφορά οκτώ open-weight μοντέλων έμεινε στην τύχη, παρότι το σήμα υπήρχε στις ενεργοποιήσεις τους.

Read MoreΜπορεί ένα AI να καταλάβει τι συμβαίνει μέσα του; Τι αποκαλύπτει το OWMI