machine learning

Δοκιμή ASR benchmarks με ηχογράφηση και ανθρώπινη αξιολόγηση

ASR benchmarks: όταν η υψηλή βαθμολογία δεν σημαίνει καλύτερη απομαγνητοφώνηση

Τα ASR benchmarks είναι αφετηρία, όχι απόδειξη πραγματικής αξιοπιστίας. Δείτε τι αποκάλυψαν τα νέα probes και πώς στήνεται σωστό held-out evaluation.

Read MoreASR benchmarks: όταν η υψηλή βαθμολογία δεν σημαίνει καλύτερη απομαγνητοφώνηση
Κλινικά όρια στην AI και αξιολόγηση προβλέψεων από ειδικούς

Κλινικά όρια στην AI: πότε η απλούστευση κάνει τις προβλέψεις πιο κατανοητές

Μια μελέτη για το ισχαιμικό εγκεφαλικό δείχνει πότε τα κατανοητά όρια διατηρούν την απόδοση ενός μοντέλου AI και πότε χάνουν κρίσιμο σήμα.

Read MoreΚλινικά όρια στην AI: πότε η απλούστευση κάνει τις προβλέψεις πιο κατανοητές
Αυτοματοποιημένη ροή εργασίας με state-matched καθοδήγηση για AI agent

SMRC-SD: γιατί η σωστή καθοδήγηση ενός AI agent εξαρτάται από την κατάστασή του

Το SMRC-SD ελέγχει αν μια επιτυχημένη διαδρομή ταιριάζει με την πραγματική κατάσταση ενός AI agent πριν τη χρησιμοποιήσει ως καθοδήγηση. Δείτε τι έδειξαν ALFWorld, WebShop και τα ablation tests.

Read MoreSMRC-SD: γιατί η σωστή καθοδήγηση ενός AI agent εξαρτάται από την κατάστασή του
Παίκτης σκακιού αποφασίζει υπό χρονική πίεση για το Otter Chess AI

Otter Chess AI: όταν το ιστορικό και το χρονόμετρο προβλέπουν την ανθρώπινη απόφαση

Το Otter Chess AI προβλέπει ανθρώπινες κινήσεις συνδυάζοντας τη σκακιέρα με ιστορικό 20 κινήσεων, Elo και πίεση χρόνου. Δείτε τι αποδεικνύει η μελέτη και πώς μεταφέρεται υπεύθυνα σε επιχειρηματικά συστήματα.

Read MoreOtter Chess AI: όταν το ιστορικό και το χρονόμετρο προβλέπουν την ανθρώπινη απόφαση
Μικρό διαγνωστικό σύστημα εντοπίζει τοπικό σφάλμα για τη Woodpecker Distillation

Woodpecker Distillation: όταν ένα ασθενέστερο AI εντοπίζει τα λάθη ενός ισχυρότερου

Η Woodpecker Distillation χρησιμοποιεί ασθενέστερο μοντέλο ως diagnostic probe. Δείτε πώς τα contrastive patches, ο verifier και τα ablations αποκαλύπτουν τοπικά reasoning bugs.

Read MoreWoodpecker Distillation: όταν ένα ασθενέστερο AI εντοπίζει τα λάθη ενός ισχυρότερου