AI Safety

Ερευνητές ελέγχουν υποδομή για monitoring των activations σε LLMs
Μηχανικός ελέγχει κύκλωμα AI για ανεξάρτητη εποπτεία με OWMI

Μπορεί ένα AI να καταλάβει τι συμβαίνει μέσα του; Τι αποκαλύπτει το OWMI

Το OWMI δείχνει ότι η λεκτική αυτοαναφορά οκτώ open-weight μοντέλων έμεινε στην τύχη, παρότι το σήμα υπήρχε στις ενεργοποιήσεις τους.

ΠερισσότεραΜπορεί ένα AI να καταλάβει τι συμβαίνει μέσα του; Τι αποκαλύπτει το OWMI
Ομάδα αξιολογεί πότε ένας AI agent πρέπει να παρέμβει ή να παραμείνει σιωπηλός

Why2Speak: γιατί η εξήγηση ενός AI agent μπορεί να αλλάζει την απόφασή του

Το Why2Speak δείχνει γιατί το reasoning μπορεί να αλλάζει την πολιτική παρέμβασης ενός AI agent και ποιοι έλεγχοι χρειάζονται πριν από deployment.

ΠερισσότεραWhy2Speak: γιατί η εξήγηση ενός AI agent μπορεί να αλλάζει την απόφασή του
AI υπό πίεση σε συγκριτική αξιολόγηση γλωσσικών μοντέλων

AI υπό πίεση: γιατί τα κορυφαία γλωσσικά μοντέλα αντιδρούν τόσο διαφορετικά

Νέα μελέτη δείχνει πώς έξι γλωσσικά μοντέλα διαφέρουν σε διευκρίνιση, άρνηση και ασφαλή εναλλακτική υπό πίεση και τι μετρά μια επιχείρηση.

ΠερισσότεραAI υπό πίεση: γιατί τα κορυφαία γλωσσικά μοντέλα αντιδρούν τόσο διαφορετικά
Ομάδα αξιολογεί αντικρουόμενες προτάσεις για τον έλεγχο AI sycophancy

AI sycophancy: πότε ένα μοντέλο αλλάζει γνώμη μόνο και μόνο για να συμφωνήσει μαζί σου

Η μελέτη CAP μετρά πότε ένα LLM αλλάζει θέση μόνο για να συμφωνήσει και δείχνει πώς οι ομάδες μπορούν να ελέγχουν AI assistants ανά domain και έκδοση.

ΠερισσότεραAI sycophancy: πότε ένα μοντέλο αλλάζει γνώμη μόνο και μόνο για να συμφωνήσει μαζί σου