Ασφάλεια AI

Ασφάλεια LLM μετά το fine-tuning σε περιβάλλον πολλαπλών prompt templates

Ασφάλεια LLM μετά το fine-tuning: γιατί το prompt template μπορεί να ακυρώσει την άμυνα

Η ασφάλεια LLM μετά το fine-tuning απαιτεί cross-template tests. Δείτε πώς το ROPD μειώνει το ASR χωρίς να θυσιάζει την εξειδικευμένη ικανότητα.

ΠερισσότεραΑσφάλεια LLM μετά το fine-tuning: γιατί το prompt template μπορεί να ακυρώσει την άμυνα
Ελεγχόμενη δοκιμή αυτόνομου agent για επαλήθευση reinforcement learning

Επαλήθευση πολιτικών reinforcement learning: πότε μπορούμε να εμπιστευτούμε έναν AI agent;

Η επαλήθευση reinforcement learning εξετάζει τι μπορούμε πραγματικά να εγγυηθούμε για έναν AI agent, από step-wise και multi-step ελέγχους έως preimage analysis και ανθρώπινη εποπτεία.

ΠερισσότεραΕπαλήθευση πολιτικών reinforcement learning: πότε μπορούμε να εμπιστευτούμε έναν AI agent;