Oktober 2026

Επιστήμονας ελέγχει αυτοματοποιημένη προσαρμογή εργαστηριακού πρωτοκόλλου με AI

BenchBench-Protocol: πόσο καλά προσαρμόζουν τα AI τα πραγματικά εργαστηριακά πρωτόκολλα

Το BenchBench-Protocol μετατρέπει 149 πραγματικές αλλαγές πρωτοκόλλων σε benchmark και δείχνει τι χρειάζονται τα αξιόπιστα AI evals για επιχειρήσεις.

WeiterlesenBenchBench-Protocol: πόσο καλά προσαρμόζουν τα AI τα πραγματικά εργαστηριακά πρωτόκολλα
Έλεγχος ενσωμάτωσης tax engine σε σύστημα AI χρηματοοικονομικών συμβουλών

AI χρηματοοικονομικές συμβουλές: όταν ένα tax engine χειροτέρεψε το αποτέλεσμα

Σε 30 συνθετικά χαρτοφυλάκια, ένα tax engine χειροτέρεψε το αποτέλεσμα multi-agent AI. Τι σημαίνει για RAG, testing και ασφαλή AI workflows;

WeiterlesenAI χρηματοοικονομικές συμβουλές: όταν ένα tax engine χειροτέρεψε το αποτέλεσμα
Ομάδα ελέγχει αποτυχημένες διαδρομές AI agents για δημιουργία αξιόπιστων δεδομένων εκπαίδευσης

PROOF-Gen: πώς οι αποτυχημένες διαδρομές ενός AI agent γίνονται καλύτερα δεδομένα εκπαίδευσης

Το PROOF-Gen ανακτά επιτυχημένες διαδρομές από failures AI agents και τις μετατρέπει σε καθαρά δεδομένα για πιο ασφαλές model distillation με έλεγχο.

WeiterlesenPROOF-Gen: πώς οι αποτυχημένες διαδρομές ενός AI agent γίνονται καλύτερα δεδομένα εκπαίδευσης
Ομάδα σχεδιάζει ελεγχόμενο data mixing experiment για LLM pretraining
Ομάδα αξιολογεί την prompt sensitivity και τη sycophancy ενός AI συστήματος

SyPS: όταν το ίδιο πρόβλημα κάνει το AI να αλλάζει κρίση ανάλογα με το prompt

Το SyPS δείχνει πώς κοινωνικές νύξεις αλλάζουν την κρίση των LLMs και πώς οι επιχειρήσεις μπορούν να ελέγχουν αυτή την αστάθεια πριν από το deployment.

WeiterlesenSyPS: όταν το ίδιο πρόβλημα κάνει το AI να αλλάζει κρίση ανάλογα με το prompt
Ομάδα πραγματοποιεί έλεγχο Explainable AI με robustness και fidelity

Explainable AI υπό έλεγχο: γιατί το υψηλό AUC δεν εγγυάται αξιόπιστες εξηγήσεις

Γιατί το υψηλό AUC δεν αρκεί και πώς robustness, fidelity και Trust Score ελέγχουν αν οι εξηγήσεις SHAP ή LIME είναι πραγματικά χρήσιμες.

WeiterlesenExplainable AI υπό έλεγχο: γιατί το υψηλό AUC δεν εγγυάται αξιόπιστες εξηγήσεις