machine learning

Δοκιμή ASR benchmarks με ηχογράφηση και ανθρώπινη αξιολόγηση

ASR benchmarks: όταν η υψηλή βαθμολογία δεν σημαίνει καλύτερη απομαγνητοφώνηση

Τα ASR benchmarks είναι αφετηρία, όχι απόδειξη πραγματικής αξιοπιστίας. Δείτε τι αποκάλυψαν τα νέα probes και πώς στήνεται σωστό held-out evaluation.

ΠερισσότεραASR benchmarks: όταν η υψηλή βαθμολογία δεν σημαίνει καλύτερη απομαγνητοφώνηση
Κλινικά όρια στην AI και αξιολόγηση προβλέψεων από ειδικούς

Κλινικά όρια στην AI: πότε η απλούστευση κάνει τις προβλέψεις πιο κατανοητές

Μια μελέτη για το ισχαιμικό εγκεφαλικό δείχνει πότε τα κατανοητά όρια διατηρούν την απόδοση ενός μοντέλου AI και πότε χάνουν κρίσιμο σήμα.

ΠερισσότεραΚλινικά όρια στην AI: πότε η απλούστευση κάνει τις προβλέψεις πιο κατανοητές
Ignition Index και δυναμική πληροφορίας σε υποδομή LLM

Ignition Index: τι αποκαλύπτει για το πώς «ανάβει» η πληροφορία στα LLM

Ο Ignition Index εξετάζει πόσο απότομα γίνεται προσβάσιμη η πληροφορία στα LLM και γιατί η αρχιτεκτονική αλλάζει τον σωστό άξονα μέτρησης.

ΠερισσότεραIgnition Index: τι αποκαλύπτει για το πώς «ανάβει» η πληροφορία στα LLM
Αυτοματοποιημένη ροή εργασίας με state-matched καθοδήγηση για AI agent

SMRC-SD: γιατί η σωστή καθοδήγηση ενός AI agent εξαρτάται από την κατάστασή του

Το SMRC-SD ελέγχει αν μια επιτυχημένη διαδρομή ταιριάζει με την πραγματική κατάσταση ενός AI agent πριν τη χρησιμοποιήσει ως καθοδήγηση. Δείτε τι έδειξαν ALFWorld, WebShop και τα ablation tests.

ΠερισσότεραSMRC-SD: γιατί η σωστή καθοδήγηση ενός AI agent εξαρτάται από την κατάστασή του
Παίκτης σκακιού αποφασίζει υπό χρονική πίεση για το Otter Chess AI

Otter Chess AI: όταν το ιστορικό και το χρονόμετρο προβλέπουν την ανθρώπινη απόφαση

Το Otter Chess AI προβλέπει ανθρώπινες κινήσεις συνδυάζοντας τη σκακιέρα με ιστορικό 20 κινήσεων, Elo και πίεση χρόνου. Δείτε τι αποδεικνύει η μελέτη και πώς μεταφέρεται υπεύθυνα σε επιχειρηματικά συστήματα.

ΠερισσότεραOtter Chess AI: όταν το ιστορικό και το χρονόμετρο προβλέπουν την ανθρώπινη απόφαση
Μικρό διαγνωστικό σύστημα εντοπίζει τοπικό σφάλμα για τη Woodpecker Distillation

Woodpecker Distillation: όταν ένα ασθενέστερο AI εντοπίζει τα λάθη ενός ισχυρότερου

Η Woodpecker Distillation χρησιμοποιεί ασθενέστερο μοντέλο ως diagnostic probe. Δείτε πώς τα contrastive patches, ο verifier και τα ablations αποκαλύπτουν τοπικά reasoning bugs.

ΠερισσότεραWoodpecker Distillation: όταν ένα ασθενέστερο AI εντοπίζει τα λάθη ενός ισχυρότερου