Reinforcement Learning

Ομάδα αξιολογεί το reward design και το περιβάλλον ενός AI agent

ERDM: όταν η «λανθασμένη» συμπεριφορά είναι λογική απάντηση σε λάθος περιβάλλον

Το ERDM δείχνει γιατί ένας AI agent μπορεί να μαθαίνει σωστά και να δρα λάθος όταν οι ανταμοιβές, οι επιλογές και το περιβάλλον του συγκρούονται.

Read MoreERDM: όταν η «λανθασμένη» συμπεριφορά είναι λογική απάντηση σε λάθος περιβάλλον
Επαγγελματίες εξετάζουν βιοϊατρικά τεκμήρια για το BioCheck Agent

BioCheck Agent: πώς το AI μαθαίνει να τεκμηριώνει τον βιοϊατρικό έλεγχο γεγονότων

Το BioCheck Agent αναζητά στο PubMed και συνθέτει ελέγξιμη αναφορά. Τι έδειξε το EG-GRPO για ακρίβεια, evidence quality και hallucinations στην πράξη.

Read MoreBioCheck Agent: πώς το AI μαθαίνει να τεκμηριώνει τον βιοϊατρικό έλεγχο γεγονότων
Ελεγχόμενο εργαστήριο για verified synthetic web environments και AI agents

AI agents: γιατί η εκπαίδευση χρειάζεται κόσμους που λειτουργούν πραγματικά

Πώς τα verified synthetic web environments κάνουν την εκπαίδευση AI agents πιο εκτελέσιμη, ελέγξιμη και χρήσιμη για επιχειρησιακά workflows.

Read MoreAI agents: γιατί η εκπαίδευση χρειάζεται κόσμους που λειτουργούν πραγματικά
Μηχανικός επιβλέπει ρομποτικό χειρισμό ποντικιού για εκπαίδευση GUI agents

Πέρα από την επιτυχία και την αποτυχία: πώς οι GUI agents μαθαίνουν από τη διαδρομή

Η LACL-GUI δείχνει γιατί το τελικό reward δεν αρκεί για GUI agents και πώς μήκος, απόκλιση και trajectory quality βελτιώνουν την αξιολόγηση.

Read MoreΠέρα από την επιτυχία και την αποτυχία: πώς οι GUI agents μαθαίνουν από τη διαδρομή