AI Safety

Ομάδα αξιολογεί την prompt sensitivity και τη sycophancy ενός AI συστήματος

SyPS: όταν το ίδιο πρόβλημα κάνει το AI να αλλάζει κρίση ανάλογα με το prompt

Το SyPS δείχνει πώς κοινωνικές νύξεις αλλάζουν την κρίση των LLMs και πώς οι επιχειρήσεις μπορούν να ελέγχουν αυτή την αστάθεια πριν από το deployment.

WeiterlesenSyPS: όταν το ίδιο πρόβλημα κάνει το AI να αλλάζει κρίση ανάλογα με το prompt
Ομάδα ελέγχει αυτόνομο AI σύστημα σε περιβάλλον ασφαλών δοκιμών

AI Finds a Way: όταν η τεχνητή νοημοσύνη βρίσκει δρόμους που δεν προβλέψαμε

Το AI Finds a Way συγκεντρώνει 26 ιστορίες απρόβλεπτης συμπεριφοράς. Τι σημαίνουν reward hacking, evaluator manipulation και ελεγχόμενη αυτονομία για επιχειρήσεις.

WeiterlesenAI Finds a Way: όταν η τεχνητή νοημοσύνη βρίσκει δρόμους που δεν προβλέψαμε
Μηχανικός εγκαθιστά μικρό υπολογιστή για AI safety σε CPU

AI safety σε CPU: πώς η αδειοδότηση δεδομένων γίνεται μετρήσιμο πλεονέκτημα

Η AI safety σε CPU γίνεται πρακτική όταν συνδέονται άδειες δεδομένων, ανεξάρτητο benchmark, over-defense, rebalancing και πραγματικό latency.

WeiterlesenAI safety σε CPU: πώς η αδειοδότηση δεδομένων γίνεται μετρήσιμο πλεονέκτημα
Ανθρώπινη εποπτεία σε στόλο drones με agentic AI

Agentic AI και στόλοι drones: η αυτονομία χρειάζεται διακυβέρνηση

Τι δείχνουν τα έργα NAMUR και PERSIST για την ασφαλή χρήση agentic AI σε στόλους drones, από την ανθρώπινη έγκριση έως τα ελέγξιμα εργαλεία και την αξιολόγηση.

WeiterlesenAgentic AI και στόλοι drones: η αυτονομία χρειάζεται διακυβέρνηση
Ερευνητές ελέγχουν υποδομή για monitoring των activations σε LLMs

Μπορούν τα LLMs να κρύψουν τη σκέψη τους; Το benchmark που μετρά τον έλεγχο των activations

Το Activation Controllability Benchmark δείχνει ότι πολλά LLMs αλλάζουν το εσωτερικό τους σήμα με οδηγία, άρα το monitoring χρειάζεται layered safeguards.

WeiterlesenΜπορούν τα LLMs να κρύψουν τη σκέψη τους; Το benchmark που μετρά τον έλεγχο των activations
Μηχανικός ελέγχει κύκλωμα AI για ανεξάρτητη εποπτεία με OWMI

Μπορεί ένα AI να καταλάβει τι συμβαίνει μέσα του; Τι αποκαλύπτει το OWMI

Το OWMI δείχνει ότι η λεκτική αυτοαναφορά οκτώ open-weight μοντέλων έμεινε στην τύχη, παρότι το σήμα υπήρχε στις ενεργοποιήσεις τους.

WeiterlesenΜπορεί ένα AI να καταλάβει τι συμβαίνει μέσα του; Τι αποκαλύπτει το OWMI