Large Language Models

Ομάδα ειδικών συζητά ανθρώπινη εποπτεία για AI στην ψυχική υγεία

AI και ψυχική υγεία: από την έγκαιρη ανίχνευση στην κλινική ευθύνη

Η AI στην ψυχική υγεία μπορεί να υποστηρίξει screening και κλινικές ροές, αλλά απαιτεί ανθρώπινη εποπτεία, ιδιωτικότητα και σαφή κλινική λογοδοσία.

Pročitajte višeAI και ψυχική υγεία: από την έγκαιρη ανίχνευση στην κλινική ευθύνη
AI υπό πίεση σε συγκριτική αξιολόγηση γλωσσικών μοντέλων

AI υπό πίεση: γιατί τα κορυφαία γλωσσικά μοντέλα αντιδρούν τόσο διαφορετικά

Νέα μελέτη δείχνει πώς έξι γλωσσικά μοντέλα διαφέρουν σε διευκρίνιση, άρνηση και ασφαλή εναλλακτική υπό πίεση και τι μετρά μια επιχείρηση.

Pročitajte višeAI υπό πίεση: γιατί τα κορυφαία γλωσσικά μοντέλα αντιδρούν τόσο διαφορετικά
Ομάδα αξιολογεί αντικρουόμενες προτάσεις για τον έλεγχο AI sycophancy

AI sycophancy: πότε ένα μοντέλο αλλάζει γνώμη μόνο και μόνο για να συμφωνήσει μαζί σου

Η μελέτη CAP μετρά πότε ένα LLM αλλάζει θέση μόνο για να συμφωνήσει και δείχνει πώς οι ομάδες μπορούν να ελέγχουν AI assistants ανά domain και έκδοση.

Pročitajte višeAI sycophancy: πότε ένα μοντέλο αλλάζει γνώμη μόνο και μόνο για να συμφωνήσει μαζί σου
Ομάδα υποδομών αξιολογεί απόδοση GLIDE για LLM μεγάλου context

GLIDE: πώς η υβριδική προσοχή μειώνει το κόστος των LLM μεγάλου context

Το GLIDE κατανέμει softmax και linear attention ανά layer για να μειώσει το KV-cache I/O στα LLM μεγάλου context. Τι έδειξαν οι δοκιμές σε Llama-3-8B και Mistral-7B, πού βοηθά το LoRA και γιατί κάθε deployment χρειάζεται δικά του quality και latency tests.

Pročitajte višeGLIDE: πώς η υβριδική προσοχή μειώνει το κόστος των LLM μεγάλου context
DecodeShare και έλεγχος υποδομής για decode-time αποφάσεις LLM

DecodeShare: τι συμβαίνει μέσα σε ένα LLM τη στιγμή που αποφασίζει

Το DecodeShare εντοπίζει έναν κοινό υποχώρο στις decode-time αποφάσεις των LLM και δείχνει γιατί οι παρεμβάσεις χρειάζονται έλεγχο στο πραγματικό inference.

Pročitajte višeDecodeShare: τι συμβαίνει μέσα σε ένα LLM τη στιγμή που αποφασίζει
Ομάδα ελέγχει Incomplete Prompt Jailbreaks και ασφάλεια LLM

Incomplete Prompt Jailbreaks: γιατί η μισή πρόταση μπορεί να παρακάμψει την ασφάλεια ενός LLM

Τα Incomplete Prompt Jailbreaks δείχνουν γιατί ένα LLM μπορεί να συνεχίσει επιβλαβές κείμενο πριν αρνηθεί και τι αλλάζει στο testing ασφάλειας.

Pročitajte višeIncomplete Prompt Jailbreaks: γιατί η μισή πρόταση μπορεί να παρακάμψει την ασφάλεια ενός LLM
Έλεγχος υποδομής για overthinking, κρυμμένη γνώση και AI auditing

Overthinking στα AI μοντέλα: όταν η ενισχυμένη σκέψη αποκαλύπτει κρυμμένη γνώση

Τι είναι το overthinking στα AI μοντέλα, πώς αποκαλύπτει κρυμμένη γνώση και ποια όρια χρειάζεται ένα υπεύθυνο πρόγραμμα AI auditing για επιχειρήσεις.

Pročitajte višeOverthinking στα AI μοντέλα: όταν η ενισχυμένη σκέψη αποκαλύπτει κρυμμένη γνώση
Έλεγχος πολλών εγγράφων για αξιοπιστία long-context AI και PredicateLongBench

Μεγάλο context δεν σημαίνει αξιόπιστο AI: τι αποκαλύπτει το PredicateLongBench

Το PredicateLongBench δείχνει γιατί το μεγάλο context window δεν εγγυάται αξιόπιστο AI και πώς δοκιμάζονται RAG, decoys, πληρότητα και πηγές στην πράξη.

Pročitajte višeΜεγάλο context δεν σημαίνει αξιόπιστο AI: τι αποκαλύπτει το PredicateLongBench