KI-Agenten

Ομάδα αξιολογεί το reward design και το περιβάλλον ενός AI agent

ERDM: όταν η «λανθασμένη» συμπεριφορά είναι λογική απάντηση σε λάθος περιβάλλον

Το ERDM δείχνει γιατί ένας AI agent μπορεί να μαθαίνει σωστά και να δρα λάθος όταν οι ανταμοιβές, οι επιλογές και το περιβάλλον του συγκρούονται.

WeiterlesenERDM: όταν η «λανθασμένη» συμπεριφορά είναι λογική απάντηση σε λάθος περιβάλλον
Ομάδα συγκρίνει παρόμοια προϊόντα με interactive visual grounding πριν αποφασίσει

Interactive visual grounding: γιατί το AI πρέπει να μάθει να ρωτά πριν αποφασίσει

Το interactive visual grounding δείχνει ότι ένα αξιόπιστο multimodal AI πρέπει να ζητά τη σωστή διευκρίνιση πριν επιλέξει προϊόν, εικόνα ή ενέργεια.

WeiterlesenInteractive visual grounding: γιατί το AI πρέπει να μάθει να ρωτά πριν αποφασίσει
Ομάδα software συνεργάζεται διαδοχικά στο MARS με εξειδικευμένους AI agents

MARS: όταν οι εξειδικευμένοι AI agents παραδίδουν ο ένας στον άλλο τον ίδιο κώδικα

Το MARS συντονίζει εξειδικευμένους AI agents πάνω στον ίδιο κώδικα. Τι έδειξε στο CodeContests και ποια όρια χρειάζεται μια επιχειρησιακή εφαρμογή.

WeiterlesenMARS: όταν οι εξειδικευμένοι AI agents παραδίδουν ο ένας στον άλλο τον ίδιο κώδικα
Επιστήμονας ελέγχει αυτοματοποιημένη προσαρμογή εργαστηριακού πρωτοκόλλου με AI

BenchBench-Protocol: πόσο καλά προσαρμόζουν τα AI τα πραγματικά εργαστηριακά πρωτόκολλα

Το BenchBench-Protocol μετατρέπει 149 πραγματικές αλλαγές πρωτοκόλλων σε benchmark και δείχνει τι χρειάζονται τα αξιόπιστα AI evals για επιχειρήσεις.

WeiterlesenBenchBench-Protocol: πόσο καλά προσαρμόζουν τα AI τα πραγματικά εργαστηριακά πρωτόκολλα
Έλεγχος ενσωμάτωσης tax engine σε σύστημα AI χρηματοοικονομικών συμβουλών

AI χρηματοοικονομικές συμβουλές: όταν ένα tax engine χειροτέρεψε το αποτέλεσμα

Σε 30 συνθετικά χαρτοφυλάκια, ένα tax engine χειροτέρεψε το αποτέλεσμα multi-agent AI. Τι σημαίνει για RAG, testing και ασφαλή AI workflows;

WeiterlesenAI χρηματοοικονομικές συμβουλές: όταν ένα tax engine χειροτέρεψε το αποτέλεσμα
Ομάδα ελέγχει αποτυχημένες διαδρομές AI agents για δημιουργία αξιόπιστων δεδομένων εκπαίδευσης

PROOF-Gen: πώς οι αποτυχημένες διαδρομές ενός AI agent γίνονται καλύτερα δεδομένα εκπαίδευσης

Το PROOF-Gen ανακτά επιτυχημένες διαδρομές από failures AI agents και τις μετατρέπει σε καθαρά δεδομένα για πιο ασφαλές model distillation με έλεγχο.

WeiterlesenPROOF-Gen: πώς οι αποτυχημένες διαδρομές ενός AI agent γίνονται καλύτερα δεδομένα εκπαίδευσης