machine learning

Μηχανικός ελέγχει κύκλωμα AI για ανεξάρτητη εποπτεία με OWMI

Μπορεί ένα AI να καταλάβει τι συμβαίνει μέσα του; Τι αποκαλύπτει το OWMI

Το OWMI δείχνει ότι η λεκτική αυτοαναφορά οκτώ open-weight μοντέλων έμεινε στην τύχη, παρότι το σήμα υπήρχε στις ενεργοποιήσεις τους.

ΠερισσότεραΜπορεί ένα AI να καταλάβει τι συμβαίνει μέσα του; Τι αποκαλύπτει το OWMI
Ελεγχόμενη αξιολόγηση AI μοντέλων σε επαγγελματική δοκιμαστική κουζίνα

FlavourBench: τι μας μαθαίνει μια κουζίνα για την αξιόπιστη αξιολόγηση της AI

Το FlavourBench δείχνει πώς dense reward maps, κοινά tasks και uncertainty checks κάνουν την αξιολόγηση AI μοντέλων πιο ελέγξιμη και χρήσιμη.

ΠερισσότεραFlavourBench: τι μας μαθαίνει μια κουζίνα για την αξιόπιστη αξιολόγηση της AI
Αυτόνομο ρομπότ σε αποθήκη ως παράδειγμα σύζευξης world model, AI agent και περιβάλλοντος

World models στην AI: το κρίσιμο ερώτημα δεν είναι μόνο τι προβλέπουν

Τα world models μπορεί να αφορούν το περιβάλλον, τον agent ή την κοινή διαδικασία. Η σωστή διάκριση καθορίζει support, αξιολόγηση και ασφαλή λειτουργία.

ΠερισσότεραWorld models στην AI: το κρίσιμο ερώτημα δεν είναι μόνο τι προβλέπουν
Ομάδα αξιολογεί πότε ένας AI agent πρέπει να παρέμβει ή να παραμείνει σιωπηλός

Why2Speak: γιατί η εξήγηση ενός AI agent μπορεί να αλλάζει την απόφασή του

Το Why2Speak δείχνει γιατί το reasoning μπορεί να αλλάζει την πολιτική παρέμβασης ενός AI agent και ποιοι έλεγχοι χρειάζονται πριν από deployment.

ΠερισσότεραWhy2Speak: γιατί η εξήγηση ενός AI agent μπορεί να αλλάζει την απόφασή του
Υποδομή οπτικών ινών με πολλαπλές διαδρομές για το CTQW-GNN

CTQW-GNN: πώς οι κβαντικοί περίπατοι επιχειρούν να λύσουν δύο αδυναμίες των graph neural networks

Πώς το CTQW-GNN χρησιμοποιεί κλασικά προσομοιωμένους κβαντικούς περιπάτους για heterophily και over-smoothing και τι χρειάζεται πριν από το production.

ΠερισσότεραCTQW-GNN: πώς οι κβαντικοί περίπατοι επιχειρούν να λύσουν δύο αδυναμίες των graph neural networks
Ερευνητές αξιολογούν ήχο, εικόνα και φυσικό δείγμα για ερμηνεύσιμη multimodal AI
Δοκιμή ASR benchmarks με ηχογράφηση και ανθρώπινη αξιολόγηση

ASR benchmarks: όταν η υψηλή βαθμολογία δεν σημαίνει καλύτερη απομαγνητοφώνηση

Τα ASR benchmarks είναι αφετηρία, όχι απόδειξη πραγματικής αξιοπιστίας. Δείτε τι αποκάλυψαν τα νέα probes και πώς στήνεται σωστό held-out evaluation.

ΠερισσότεραASR benchmarks: όταν η υψηλή βαθμολογία δεν σημαίνει καλύτερη απομαγνητοφώνηση