Σεπτέμβριος 2026

Ερευνητής συγκρίνει διαφορετικές διαμορφώσεις για αξιόπιστο AI benchmark harness

Δεν υπάρχει ουδέτερο AI benchmark: πώς το harness αλλάζει τον νικητή

Νέα μελέτη δείχνει ότι 26 έγκυρα evaluation harnesses μπορούν να αλλάξουν δραστικά τα scores και τον νικητή ενός LLM leaderboard. Τι σημαίνει για τις επιχειρήσεις.

ΠερισσότεραΔεν υπάρχει ουδέτερο AI benchmark: πώς το harness αλλάζει τον νικητή
Επιστημονική ομάδα ελέγχει παραδοτέα από AI agent

K-Bench: γιατί η καλή απάντηση ενός AI agent δεν σημαίνει σωστή δουλειά

Το K-Bench δείχνει γιατί η αξιολόγηση AI agents πρέπει να ελέγχει ακρίβεια, artifacts και overclaiming — όχι μόνο μια πειστική απάντηση.

ΠερισσότεραK-Bench: γιατί η καλή απάντηση ενός AI agent δεν σημαίνει σωστή δουλειά
Ερευνητές ελέγχουν υποδομή για monitoring των activations σε LLMs
Αστικό τοπίο για CLIP και περιφερειακό γεωεντοπισμό

Τι μαθαίνει το CLIP για μια πόλη; Η προσαρμογή αποκαλύπτει τη δύναμη της σκηνής

Η προσαρμογή του CLIP βελτιώνει τον περιφερειακό γεωεντοπισμό, αλλά το scene configuration και το train–test overlap καθορίζουν την ερμηνεία.

ΠερισσότεραΤι μαθαίνει το CLIP για μια πόλη; Η προσαρμογή αποκαλύπτει τη δύναμη της σκηνής
Ομάδα ελέγχει Actor Judge Editor AI planning σε επιχειρησιακό workflow

Actor, Judge, Editor: πώς η AI μαθαίνει να σχεδιάζει χωρίς να αλλάζει τον στόχο

Το Actor–Judge–Editor μαθαίνει συμβολικό planning από solver feedback, ξεχωρίζοντας την τεχνική επιτυχία από την πιστότητα στον αρχικό στόχο.

ΠερισσότεραActor, Judge, Editor: πώς η AI μαθαίνει να σχεδιάζει χωρίς να αλλάζει τον στόχο