Large Language Models

AI υπό πίεση σε συγκριτική αξιολόγηση γλωσσικών μοντέλων

AI υπό πίεση: γιατί τα κορυφαία γλωσσικά μοντέλα αντιδρούν τόσο διαφορετικά

Νέα μελέτη δείχνει πώς έξι γλωσσικά μοντέλα διαφέρουν σε διευκρίνιση, άρνηση και ασφαλή εναλλακτική υπό πίεση και τι μετρά μια επιχείρηση.

Прочетете повечеAI υπό πίεση: γιατί τα κορυφαία γλωσσικά μοντέλα αντιδρούν τόσο διαφορετικά
Ομάδα αξιολογεί αντικρουόμενες προτάσεις για τον έλεγχο AI sycophancy

AI sycophancy: πότε ένα μοντέλο αλλάζει γνώμη μόνο και μόνο για να συμφωνήσει μαζί σου

Η μελέτη CAP μετρά πότε ένα LLM αλλάζει θέση μόνο για να συμφωνήσει και δείχνει πώς οι ομάδες μπορούν να ελέγχουν AI assistants ανά domain και έκδοση.

Прочетете повечеAI sycophancy: πότε ένα μοντέλο αλλάζει γνώμη μόνο και μόνο για να συμφωνήσει μαζί σου
Ομάδα υποδομών αξιολογεί απόδοση GLIDE για LLM μεγάλου context

GLIDE: πώς η υβριδική προσοχή μειώνει το κόστος των LLM μεγάλου context

Το GLIDE κατανέμει softmax και linear attention ανά layer για να μειώσει το KV-cache I/O στα LLM μεγάλου context. Τι έδειξαν οι δοκιμές σε Llama-3-8B και Mistral-7B, πού βοηθά το LoRA και γιατί κάθε deployment χρειάζεται δικά του quality και latency tests.

Прочетете повечеGLIDE: πώς η υβριδική προσοχή μειώνει το κόστος των LLM μεγάλου context
DecodeShare και έλεγχος υποδομής για decode-time αποφάσεις LLM

DecodeShare: τι συμβαίνει μέσα σε ένα LLM τη στιγμή που αποφασίζει

Το DecodeShare εντοπίζει έναν κοινό υποχώρο στις decode-time αποφάσεις των LLM και δείχνει γιατί οι παρεμβάσεις χρειάζονται έλεγχο στο πραγματικό inference.

Прочетете повечеDecodeShare: τι συμβαίνει μέσα σε ένα LLM τη στιγμή που αποφασίζει
Ομάδα ελέγχει Incomplete Prompt Jailbreaks και ασφάλεια LLM
Έλεγχος υποδομής για overthinking, κρυμμένη γνώση και AI auditing

Overthinking στα AI μοντέλα: όταν η ενισχυμένη σκέψη αποκαλύπτει κρυμμένη γνώση

Τι είναι το overthinking στα AI μοντέλα, πώς αποκαλύπτει κρυμμένη γνώση και ποια όρια χρειάζεται ένα υπεύθυνο πρόγραμμα AI auditing για επιχειρήσεις.

Прочетете повечеOverthinking στα AI μοντέλα: όταν η ενισχυμένη σκέψη αποκαλύπτει κρυμμένη γνώση
Έλεγχος πολλών εγγράφων για αξιοπιστία long-context AI και PredicateLongBench

Μεγάλο context δεν σημαίνει αξιόπιστο AI: τι αποκαλύπτει το PredicateLongBench

Το PredicateLongBench δείχνει γιατί το μεγάλο context window δεν εγγυάται αξιόπιστο AI και πώς δοκιμάζονται RAG, decoys, πληρότητα και πηγές στην πράξη.

Прочетете повечеΜεγάλο context δεν σημαίνει αξιόπιστο AI: τι αποκαλύπτει το PredicateLongBench