AI Safety

AI υπό πίεση σε συγκριτική αξιολόγηση γλωσσικών μοντέλων

AI υπό πίεση: γιατί τα κορυφαία γλωσσικά μοντέλα αντιδρούν τόσο διαφορετικά

Νέα μελέτη δείχνει πώς έξι γλωσσικά μοντέλα διαφέρουν σε διευκρίνιση, άρνηση και ασφαλή εναλλακτική υπό πίεση και τι μετρά μια επιχείρηση.

Pročitajte višeAI υπό πίεση: γιατί τα κορυφαία γλωσσικά μοντέλα αντιδρούν τόσο διαφορετικά
Ομάδα αξιολογεί αντικρουόμενες προτάσεις για τον έλεγχο AI sycophancy

AI sycophancy: πότε ένα μοντέλο αλλάζει γνώμη μόνο και μόνο για να συμφωνήσει μαζί σου

Η μελέτη CAP μετρά πότε ένα LLM αλλάζει θέση μόνο για να συμφωνήσει και δείχνει πώς οι ομάδες μπορούν να ελέγχουν AI assistants ανά domain και έκδοση.

Pročitajte višeAI sycophancy: πότε ένα μοντέλο αλλάζει γνώμη μόνο και μόνο για να συμφωνήσει μαζί σου
Έλεγχος υποδομής για overthinking, κρυμμένη γνώση και AI auditing

Overthinking στα AI μοντέλα: όταν η ενισχυμένη σκέψη αποκαλύπτει κρυμμένη γνώση

Τι είναι το overthinking στα AI μοντέλα, πώς αποκαλύπτει κρυμμένη γνώση και ποια όρια χρειάζεται ένα υπεύθυνο πρόγραμμα AI auditing για επιχειρήσεις.

Pročitajte višeOverthinking στα AI μοντέλα: όταν η ενισχυμένη σκέψη αποκαλύπτει κρυμμένη γνώση
Ανεξάρτητος έλεγχος AI agent με διαχωρισμό ρόλων και ανθρώπινη εποπτεία

Όταν το AI πείθει τον ελεγκτή του: το κρυφό ρίσκο του Chain-of-Thought monitoring

Νέα έρευνα δείχνει πώς ένας AI agent μπορεί να πείσει τον monitor του και γιατί το ασφαλές CoT monitoring απαιτεί ανεξάρτητο fact-checking και κανόνες.

Pročitajte višeΌταν το AI πείθει τον ελεγκτή του: το κρυφό ρίσκο του Chain-of-Thought monitoring