AI governance

Τεχνικός έλεγχος προέλευσης και λειτουργικής ροής για AI skills
Ομάδα αξιολογεί αντικρουόμενες προτάσεις για τον έλεγχο AI sycophancy

AI sycophancy: πότε ένα μοντέλο αλλάζει γνώμη μόνο και μόνο για να συμφωνήσει μαζί σου

Η μελέτη CAP μετρά πότε ένα LLM αλλάζει θέση μόνο για να συμφωνήσει και δείχνει πώς οι ομάδες μπορούν να ελέγχουν AI assistants ανά domain και έκδοση.

Прочетете повечеAI sycophancy: πότε ένα μοντέλο αλλάζει γνώμη μόνο και μόνο για να συμφωνήσει μαζί σου
Два роботизирани AI агента се координират чрез обща връзка в промишлена лаборатория

Действително ли «говорят» AI агентите? Какво разкрива причинно-следственият анализ на латентните съобщения

Латентната комуникация между AI агентите изисква проверка на причинно-следствените връзки, а не само точност. Вижте какво разкриват CAG, SSG и контролираните замествания.

Прочетете повечеДействително ли «говорят» AI агентите? Какво разкрива причинно-следственият анализ на латентните съобщения
Ασφάλεια LLM μετά το fine-tuning σε περιβάλλον πολλαπλών prompt templates

Ασφάλεια LLM μετά το fine-tuning: γιατί το prompt template μπορεί να ακυρώσει την άμυνα

Η ασφάλεια LLM μετά το fine-tuning απαιτεί cross-template tests. Δείτε πώς το ROPD μειώνει το ASR χωρίς να θυσιάζει την εξειδικευμένη ικανότητα.

Прочетете повечеΑσφάλεια LLM μετά το fine-tuning: γιατί το prompt template μπορεί να ακυρώσει την άμυνα
Ομάδα ελέγχει δεδομένα εκπαίδευσης AI για ιχνηλασιμότητα με FrED και knowledge graphs

FrED: πώς τα knowledge graphs φωτίζουν τα δεδομένα πίσω από ένα AI

Το FrED συνδυάζει latent similarity και knowledge graphs για black-box Training Data Attribution. Τι έδειξαν τα πειράματα, πού σταματά η απόδειξη και πώς μπορεί να αξιολογηθεί επιχειρηματικά.

Прочетете повечеFrED: πώς τα knowledge graphs φωτίζουν τα δεδομένα πίσω από ένα AI
Ομάδα ελέγχει Incomplete Prompt Jailbreaks και ασφάλεια LLM