септември 2026 г.

Επαγγελματίας υγείας δοκιμάζει on-device AI screening με smartphone

AI screening για καρκίνο στόματος: γιατί το μικρό MobileViTv2 κέρδισε

Η μελέτη MobileViTv2 δείχνει γιατί το ασφαλές AI screening καρκίνου στόματος χρειάζεται μικρό μοντέλο, quality gates και κλινική επικύρωση.

Прочетете повечеAI screening για καρκίνο στόματος: γιατί το μικρό MobileViTv2 κέρδισε
Ερευνητής συγκρίνει διαφορετικές διαμορφώσεις για αξιόπιστο AI benchmark harness

Δεν υπάρχει ουδέτερο AI benchmark: πώς το harness αλλάζει τον νικητή

Νέα μελέτη δείχνει ότι 26 έγκυρα evaluation harnesses μπορούν να αλλάξουν δραστικά τα scores και τον νικητή ενός LLM leaderboard. Τι σημαίνει για τις επιχειρήσεις.

Прочетете повечеΔεν υπάρχει ουδέτερο AI benchmark: πώς το harness αλλάζει τον νικητή
Επιστημονική ομάδα ελέγχει παραδοτέα από AI agent

K-Bench: γιατί η καλή απάντηση ενός AI agent δεν σημαίνει σωστή δουλειά

Το K-Bench δείχνει γιατί η αξιολόγηση AI agents πρέπει να ελέγχει ακρίβεια, artifacts και overclaiming — όχι μόνο μια πειστική απάντηση.

Прочетете повечеK-Bench: γιατί η καλή απάντηση ενός AI agent δεν σημαίνει σωστή δουλειά
Ερευνητές ελέγχουν υποδομή για monitoring των activations σε LLMs
Αστικό τοπίο για CLIP και περιφερειακό γεωεντοπισμό
Ομάδα ελέγχει Actor Judge Editor AI planning σε επιχειρησιακό workflow

Actor, Judge, Editor: πώς η AI μαθαίνει να σχεδιάζει χωρίς να αλλάζει τον στόχο

Το Actor–Judge–Editor μαθαίνει συμβολικό planning από solver feedback, ξεχωρίζοντας την τεχνική επιτυχία από την πιστότητα στον αρχικό στόχο.

Прочетете повечеActor, Judge, Editor: πώς η AI μαθαίνει να σχεδιάζει χωρίς να αλλάζει τον στόχο