AI benchmarks

Ερευνητής συγκρίνει διαφορετικές διαμορφώσεις για αξιόπιστο AI benchmark harness

Δεν υπάρχει ουδέτερο AI benchmark: πώς το harness αλλάζει τον νικητή

Νέα μελέτη δείχνει ότι 26 έγκυρα evaluation harnesses μπορούν να αλλάξουν δραστικά τα scores και τον νικητή ενός LLM leaderboard. Τι σημαίνει για τις επιχειρήσεις.

ΠερισσότεραΔεν υπάρχει ουδέτερο AI benchmark: πώς το harness αλλάζει τον νικητή
Επιστημονική ομάδα ελέγχει παραδοτέα από AI agent

K-Bench: γιατί η καλή απάντηση ενός AI agent δεν σημαίνει σωστή δουλειά

Το K-Bench δείχνει γιατί η αξιολόγηση AI agents πρέπει να ελέγχει ακρίβεια, artifacts και overclaiming — όχι μόνο μια πειστική απάντηση.

ΠερισσότεραK-Bench: γιατί η καλή απάντηση ενός AI agent δεν σημαίνει σωστή δουλειά
Ελεγχόμενη αξιολόγηση AI μοντέλων σε επαγγελματική δοκιμαστική κουζίνα

FlavourBench: τι μας μαθαίνει μια κουζίνα για την αξιόπιστη αξιολόγηση της AI

Το FlavourBench δείχνει πώς dense reward maps, κοινά tasks και uncertainty checks κάνουν την αξιολόγηση AI μοντέλων πιο ελέγξιμη και χρήσιμη.

ΠερισσότεραFlavourBench: τι μας μαθαίνει μια κουζίνα για την αξιόπιστη αξιολόγηση της AI
Ομάδα ελέγχει Medical AI specialization σε υπολογιστικό εργαστήριο
Μηχανικοί διαχειρίζονται ελεγχόμενη μνήμη AI agents σε υποδομή server
Ομάδα επιβλέπει υποδομή server για terminal agents
Έλεγχος visual AI με μερικώς κρυμμένα αντικείμενα σε περιβάλλον αποθήκης

StateSight: γιατί τα vision-language models βλέπουν σωστά αλλά χάνουν τη χωρική δομή

Το StateSight δείχνει γιατί μια format-valid απάντηση δεν αποδεικνύει χωρική ορθότητα και πώς σχεδιάζεται task-specific έλεγχος πριν από το production.

ΠερισσότεραStateSight: γιατί τα vision-language models βλέπουν σωστά αλλά χάνουν τη χωρική δομή
Ρομπότ σε σύνθετο περιβάλλον δοκιμών για το Transition Complexity Profile