AI Safety

Ομάδα αξιολογεί την prompt sensitivity και τη sycophancy ενός AI συστήματος

SyPS: όταν το ίδιο πρόβλημα κάνει το AI να αλλάζει κρίση ανάλογα με το prompt

Το SyPS δείχνει πώς κοινωνικές νύξεις αλλάζουν την κρίση των LLMs και πώς οι επιχειρήσεις μπορούν να ελέγχουν αυτή την αστάθεια πριν από το deployment.

ΠερισσότεραSyPS: όταν το ίδιο πρόβλημα κάνει το AI να αλλάζει κρίση ανάλογα με το prompt
Ομάδα ελέγχει αυτόνομο AI σύστημα σε περιβάλλον ασφαλών δοκιμών

AI Finds a Way: όταν η τεχνητή νοημοσύνη βρίσκει δρόμους που δεν προβλέψαμε

Το AI Finds a Way συγκεντρώνει 26 ιστορίες απρόβλεπτης συμπεριφοράς. Τι σημαίνουν reward hacking, evaluator manipulation και ελεγχόμενη αυτονομία για επιχειρήσεις.

ΠερισσότεραAI Finds a Way: όταν η τεχνητή νοημοσύνη βρίσκει δρόμους που δεν προβλέψαμε
Μηχανικός εγκαθιστά μικρό υπολογιστή για AI safety σε CPU

AI safety σε CPU: πώς η αδειοδότηση δεδομένων γίνεται μετρήσιμο πλεονέκτημα

Η AI safety σε CPU γίνεται πρακτική όταν συνδέονται άδειες δεδομένων, ανεξάρτητο benchmark, over-defense, rebalancing και πραγματικό latency.

ΠερισσότεραAI safety σε CPU: πώς η αδειοδότηση δεδομένων γίνεται μετρήσιμο πλεονέκτημα
Ανθρώπινη εποπτεία σε στόλο drones με agentic AI

Agentic AI και στόλοι drones: η αυτονομία χρειάζεται διακυβέρνηση

Τι δείχνουν τα έργα NAMUR και PERSIST για την ασφαλή χρήση agentic AI σε στόλους drones, από την ανθρώπινη έγκριση έως τα ελέγξιμα εργαλεία και την αξιολόγηση.

ΠερισσότεραAgentic AI και στόλοι drones: η αυτονομία χρειάζεται διακυβέρνηση
Σύμβουλος εξετάζει πότε η AI πρέπει να ρωτά πριν απαντήσει

Ask or Answer: πότε ένα AI πρέπει να ρωτά πριν διορθώσει λάθος πληροφορίες

Το RO-PnR μαθαίνει πότε ένα AI πρέπει να ζητά διευκρίνιση και πότε να απαντά, συνυπολογίζοντας ποιότητα, κόστος και ασφάλεια.

ΠερισσότεραAsk or Answer: πότε ένα AI πρέπει να ρωτά πριν διορθώσει λάθος πληροφορίες
Ερευνητές ελέγχουν υποδομή για monitoring των activations σε LLMs
Μηχανικός ελέγχει κύκλωμα AI για ανεξάρτητη εποπτεία με OWMI

Μπορεί ένα AI να καταλάβει τι συμβαίνει μέσα του; Τι αποκαλύπτει το OWMI

Το OWMI δείχνει ότι η λεκτική αυτοαναφορά οκτώ open-weight μοντέλων έμεινε στην τύχη, παρότι το σήμα υπήρχε στις ενεργοποιήσεις τους.

ΠερισσότεραΜπορεί ένα AI να καταλάβει τι συμβαίνει μέσα του; Τι αποκαλύπτει το OWMI