Reinforcement Learning

Ομάδα αξιολογεί το reward design και το περιβάλλον ενός AI agent

ERDM: όταν η «λανθασμένη» συμπεριφορά είναι λογική απάντηση σε λάθος περιβάλλον

Το ERDM δείχνει γιατί ένας AI agent μπορεί να μαθαίνει σωστά και να δρα λάθος όταν οι ανταμοιβές, οι επιλογές και το περιβάλλον του συγκρούονται.

WeiterlesenERDM: όταν η «λανθασμένη» συμπεριφορά είναι λογική απάντηση σε λάθος περιβάλλον
Επαγγελματίες εξετάζουν βιοϊατρικά τεκμήρια για το BioCheck Agent

BioCheck Agent: πώς το AI μαθαίνει να τεκμηριώνει τον βιοϊατρικό έλεγχο γεγονότων

Το BioCheck Agent αναζητά στο PubMed και συνθέτει ελέγξιμη αναφορά. Τι έδειξε το EG-GRPO για ακρίβεια, evidence quality και hallucinations στην πράξη.

WeiterlesenBioCheck Agent: πώς το AI μαθαίνει να τεκμηριώνει τον βιοϊατρικό έλεγχο γεγονότων
Ομάδα ελέγχει αυτόνομο AI σύστημα σε περιβάλλον ασφαλών δοκιμών

AI Finds a Way: όταν η τεχνητή νοημοσύνη βρίσκει δρόμους που δεν προβλέψαμε

Το AI Finds a Way συγκεντρώνει 26 ιστορίες απρόβλεπτης συμπεριφοράς. Τι σημαίνουν reward hacking, evaluator manipulation και ελεγχόμενη αυτονομία για επιχειρήσεις.

WeiterlesenAI Finds a Way: όταν η τεχνητή νοημοσύνη βρίσκει δρόμους που δεν προβλέψαμε
Μηχανικός ελέγχει υπολογιστικές διαδρομές για CompPO credit assignment

CompPO: όταν το Transformer καθοδηγεί πού πηγαίνει η ανταμοιβή

Το CompPO συνδέει το credit assignment στα LLM με την εσωτερική υπολογιστική διαδρομή του Transformer. Τι έδειξε, πού σταματούν τα στοιχεία και τι χρειάζεται ένα ασφαλές pilot.

WeiterlesenCompPO: όταν το Transformer καθοδηγεί πού πηγαίνει η ανταμοιβή
Ελεγχόμενο εργαστήριο για verified synthetic web environments και AI agents

AI agents: γιατί η εκπαίδευση χρειάζεται κόσμους που λειτουργούν πραγματικά

Πώς τα verified synthetic web environments κάνουν την εκπαίδευση AI agents πιο εκτελέσιμη, ελέγξιμη και χρήσιμη για επιχειρησιακά workflows.

WeiterlesenAI agents: γιατί η εκπαίδευση χρειάζεται κόσμους που λειτουργούν πραγματικά
Μηχανικός επιβλέπει ρομποτικό χειρισμό ποντικιού για εκπαίδευση GUI agents

Πέρα από την επιτυχία και την αποτυχία: πώς οι GUI agents μαθαίνουν από τη διαδρομή

Η LACL-GUI δείχνει γιατί το τελικό reward δεν αρκεί για GUI agents και πώς μήκος, απόκλιση και trajectory quality βελτιώνουν την αξιολόγηση.

WeiterlesenΠέρα από την επιτυχία και την αποτυχία: πώς οι GUI agents μαθαίνουν από τη διαδρομή
Ερευνητές καθοδηγούν ρομποτικό σύστημα για sparse reward εκπαίδευση AI

Όταν το reward σωπαίνει: hints, critics και teachers στην εκπαίδευση AI

Μια ελεγχόμενη σύγκριση 11 μεθόδων δείχνει πότε hints, distillation και critics βοηθούν την AI με sparse reward — και πώς ένα benchmark μπορεί να αντιστρέψει το συμπέρασμα.

WeiterlesenΌταν το reward σωπαίνει: hints, critics και teachers στην εκπαίδευση AI
Ομάδα ελέγχει Actor Judge Editor AI planning σε επιχειρησιακό workflow

Actor, Judge, Editor: πώς η AI μαθαίνει να σχεδιάζει χωρίς να αλλάζει τον στόχο

Το Actor–Judge–Editor μαθαίνει συμβολικό planning από solver feedback, ξεχωρίζοντας την τεχνική επιτυχία από την πιστότητα στον αρχικό στόχο.

WeiterlesenActor, Judge, Editor: πώς η AI μαθαίνει να σχεδιάζει χωρίς να αλλάζει τον στόχο