machine learning

Ομάδα σχεδιάζει ελεγχόμενο data mixing experiment για LLM pretraining
Ομάδα e-commerce σχεδιάζει pilot πρόβλεψης ζήτησης με ICI-Time

ICI-Time: όταν ένα vision model προβλέπει χρονοσειρές σαν να συμπληρώνει εικόνες

Το ICI-Time μετατρέπει χρονοσειρές σε εικόνες και αξιοποιεί visual in-context learning για forecasting. Τι δείχνουν τα few-shot αποτελέσματα και τι απαιτεί ένα ασφαλές επιχειρησιακό pilot.

ΠερισσότεραICI-Time: όταν ένα vision model προβλέπει χρονοσειρές σαν να συμπληρώνει εικόνες
Ειδικοί οργανώνουν μεγάλα εταιρικά έγγραφα για αναζήτηση με multi-vector embeddings

Multi-vector embeddings: πώς το domain finetuning αλλάζει την εταιρική αναζήτηση

Τα multi-vector embeddings βελτιώνουν την εταιρική αναζήτηση όταν domain data, μήκος εγγράφων, evaluation και index μετρώνται μαζί σε πραγματικά queries.

ΠερισσότεραMulti-vector embeddings: πώς το domain finetuning αλλάζει την εταιρική αναζήτηση
Μηχανικοί ελέγχουν αισθητήρες για explainable AI στις χρονοσειρές

Explainable AI στις χρονοσειρές: όταν το ίδιο μοντέλο δίνει άλλη εξήγηση

Το explainable AI στις χρονοσειρές αλλάζει ανά framework. Η ανασκόπηση έξι εργαλείων δείχνει κενά σε methods, metrics, συχνότητες και αναπαραγωγιμότητα.

ΠερισσότεραExplainable AI στις χρονοσειρές: όταν το ίδιο μοντέλο δίνει άλλη εξήγηση
Ερευνητής συγκρίνει διαφορετικές διαμορφώσεις για αξιόπιστο AI benchmark harness

Δεν υπάρχει ουδέτερο AI benchmark: πώς το harness αλλάζει τον νικητή

Νέα μελέτη δείχνει ότι 26 έγκυρα evaluation harnesses μπορούν να αλλάξουν δραστικά τα scores και τον νικητή ενός LLM leaderboard. Τι σημαίνει για τις επιχειρήσεις.

ΠερισσότεραΔεν υπάρχει ουδέτερο AI benchmark: πώς το harness αλλάζει τον νικητή
Μηχανικός ελέγχει κύκλωμα AI για ανεξάρτητη εποπτεία με OWMI

Μπορεί ένα AI να καταλάβει τι συμβαίνει μέσα του; Τι αποκαλύπτει το OWMI

Το OWMI δείχνει ότι η λεκτική αυτοαναφορά οκτώ open-weight μοντέλων έμεινε στην τύχη, παρότι το σήμα υπήρχε στις ενεργοποιήσεις τους.

ΠερισσότεραΜπορεί ένα AI να καταλάβει τι συμβαίνει μέσα του; Τι αποκαλύπτει το OWMI
Ελεγχόμενη αξιολόγηση AI μοντέλων σε επαγγελματική δοκιμαστική κουζίνα

FlavourBench: τι μας μαθαίνει μια κουζίνα για την αξιόπιστη αξιολόγηση της AI

Το FlavourBench δείχνει πώς dense reward maps, κοινά tasks και uncertainty checks κάνουν την αξιολόγηση AI μοντέλων πιο ελέγξιμη και χρήσιμη.

ΠερισσότεραFlavourBench: τι μας μαθαίνει μια κουζίνα για την αξιόπιστη αξιολόγηση της AI