Scroll: γιατί η μνήμη των AI agents πρέπει να είναι περιβάλλον, όχι περίληψη

Πώς το Scroll μετατρέπει τη μνήμη AI agents σε εκτελέσιμο περιβάλλον με Event Log, provenance, persistent computation και επιλεκτικό context.

Απάντηση πρώτα: η αξιόπιστη μνήμη ενός AI agent δεν χρειάζεται να χωρά ολόκληρη στο prompt ούτε να αντικαθιστά το παρελθόν με μία περίληψη. Χρειάζεται να διατηρεί το πλήρες ιστορικό εκτός του ενεργού context, να το ανακτά με σταθερές διευθύνσεις και να εμφανίζει στο μοντέλο μόνο τις αποδείξεις που απαιτεί η τρέχουσα απόφαση.

Το ερευνητικό Scroll μετατρέπει αυτή την αρχή σε εκτελέσιμο Session Environment: append-only Event Log, durable storage και persistent Python kernel. Τα αποτελέσματά του σε LongMemEval, BEAM και LOCA είναι ισχυρά, αλλά αφορούν τη συγκεκριμένη πειραματική ρύθμιση. Για μια επιχείρηση, το σημαντικότερο μάθημα είναι η αρχιτεκτονική: πρωτότυπα records, provenance, computation εκτός prompt και ελάχιστη αναγκαία προβολή.

Съдържание

Γιατί ένα μεγαλύτερο context window δεν αρκεί

Ένας agent που εργάζεται για ώρες, ημέρες ή πολλές συνεδρίες συσσωρεύει μηνύματα, tool calls, αποτελέσματα, διορθώσεις και artifacts. Ακόμη και αν το ονομαστικό context window μεγαλώνει, το ιστορικό συνεχίζει να αυξάνεται και η αξιόπιστη ανάκτηση μέσα σε πολύ μεγάλο input παραμένει δύσκολη. Το πρόβλημα επομένως δεν είναι μόνο πόσα tokens χωρούν, αλλά ποια στοιχεία πρέπει να είναι ορατά στην επόμενη απόφαση.

Η συνηθισμένη λύση είναι το compaction: παλαιότερα turns συνοψίζονται, tool outputs διπλώνονται ή επιλεγμένα facts μεταφέρονται σε εξωτερική μνήμη. Αυτό μειώνει το ενεργό φορτίο, αλλά η επιλογή γίνεται πριν γίνει γνωστή η μελλοντική ερώτηση. Μια περίληψη μπορεί να κρατήσει το συμπέρασμα και να χάσει την ακριβή τιμή, τη χρονική σειρά, την εξαίρεση ή την προέλευση που αργότερα θα είναι κρίσιμη.

Το ίδιο όριο εμφανίζεται όταν ένα μεγάλο context παρουσιάζεται ως αυτόματη εγγύηση. Όπως δείχνει και η ανάλυση για το γιατί το μεγάλο context δεν σημαίνει από μόνο του αξιόπιστο AI, η χωρητικότητα και η πραγματική ικανότητα εντοπισμού της σωστής απόδειξης είναι διαφορετικά πράγματα.

Περίληψη ή εκτελέσιμο περιβάλλον;

Το Scroll, από ερευνητές των Alibaba Group και Columbia University, προτείνει να μη θεωρείται η ιστορία κείμενο που πρέπει να χωρέσει στο prompt. Τη θεωρεί Session Environment: ένα μόνιμο περιβάλλον που ο agent μπορεί να αναζητήσει, να επεκτείνει και να επεξεργαστεί προγραμματιστικά. Το πλήρες state μένει εκτός context και το μοντέλο δημιουργεί κάθε φορά μια περιορισμένη working view.

Περίληψη ιστορίας

Μειώνει γρήγορα τα tokens, αλλά αποφασίζει κατά το compaction τι θα επιβιώσει. Αν η περίληψη αντικαταστήσει το πρωτότυπο, μια χαμένη λεπτομέρεια δεν ανακτάται.

Χαμηλότερο inputLossy επιλογή

Εξωτερική μνήμη

Εξάγει facts, επεισόδια ή embeddings και τα αναζητά αργότερα. Βοηθά στην ανάκτηση, αλλά το ingestion schema προκαθορίζει τι αποθηκεύεται και με ποια μορφή.

Στοχευμένο retrievalFixed representation

Scroll

Κρατά τα πρωτότυπα events και payloads, γράφει query-time κώδικα πάνω στο ιστορικό και εκθέτει μόνο το επιλεγμένο projection στην επόμενη κλήση.

Lossless recordProgrammatic context

Η διαφορά δεν σημαίνει ότι οι περιλήψεις είναι άχρηστες. Σημαίνει ότι λειτουργούν καλύτερα ως ευρετήρια, navigation aids ή handover views και όχι ως μοναδικό αρχείο αλήθειας. Η ίδια αρχή ισχύει στη μνημονική υγιεινή των AI agents: η χωρητικότητα έχει μικρή αξία όταν η μνήμη δεν διαχωρίζει evidence, συμπέρασμα και παρωχημένη πληροφορία.

Τα τρία επίπεδα του Session Environment

Το πρώτο επίπεδο είναι ένα append-only Event Log. Κάθε μήνυμα, model response, tool call και tool result καταγράφεται με metadata και λαμβάνει μια αμετάβλητη, αυξανόμενη διεύθυνση seq. Στην υλοποίηση της εργασίας τα events αποθηκεύονται σε SQLite και η προεπιλεγμένη αναζήτηση χρησιμοποιεί BM25, ώστε το indexing να είναι ντετερμινιστικό και να μη χρειάζεται πρόσθετα model calls.

Το δεύτερο επίπεδο είναι το durable storage των payloads. Μικρά αποτελέσματα μπορούν να παραμένουν μέσα στη βάση, ενώ μεγάλα JSON outputs ή artifacts εξωτερικεύονται στο filesystem. Το event κρατά bounded preview και recovery pointer. Έτσι η απόδειξη ότι ένα εργαλείο εκτελέστηκε, ο χρόνος και η θέση του αποτελέσματος μένουν στο log χωρίς κάθε byte να μεταφέρεται σε κάθε prompt.

Το τρίτο επίπεδο είναι ένας sandboxed Python kernel που επιβιώνει ανάμεσα στις κλήσεις του μοντέλου. Η namespace κρατά typed μεταβλητές, lazy handles και παράγωγα αποτελέσματα μαζί με provenance metadata. Ένας μεγάλος πίνακας μπορεί να φορτωθεί μία φορά, να φιλτραριστεί και να συνδυαστεί σε επόμενα βήματα, ενώ στο context επιστρέφει μόνο το μικρό αποτέλεσμα που χρειάζεται η απόφαση.

Αυτή η σύνδεση πρωτότυπου record και provenance θυμίζει το βασικό μάθημα του ECHO για μνήμη AI agents με αποδείξεις: η ομοιότητα ενός ανακτημένου αποσπάσματος δεν αρκεί όταν δεν μπορούμε να δείξουμε ποιο event, artifact ή μετασχηματισμός στήριξε το συμπέρασμα.

Exec και print: το πραγματικό φίλτρο του context

Στο Scroll, το exec είναι η διεπαφή με τη μνήμη. Ο agent γράφει κώδικα για να εντοπίσει records, να επεκτείνει συγκεκριμένες διευθύνσεις, να κάνει filters, joins και aggregations ή να καλέσει επιτρεπόμενα εργαλεία. Οι μεταβλητές και τα ενδιάμεσα αντικείμενα μένουν στον kernel αντί να σειριοποιούνται ξανά στο prompt.

Сайтът print είναι η πύλη προς την επόμενη model call. Μόνο ό,τι εκτυπώνεται ρητά περνά στη bounded observation. Αν ένα computation διαβάσει χιλιάδες records και τυπώσει πέντε ευρήματα με τις διευθύνσεις των αποδείξεων, το μοντέλο βλέπει αυτά τα πέντε ευρήματα και όχι ολόκληρο το σύνολο.

Κανόνας context construction

Το πλήρες ιστορικό μένει διαθέσιμο, αλλά το μοντέλο βλέπει μόνο το ελάχιστο επαρκές evidence

Διατηρήστε τα πρωτότυπα events αμετάβλητα, χρησιμοποιήστε summaries και indexes για πλοήγηση, εκτελέστε filters και aggregations εκτός prompt και επιτρέψτε στο επόμενο model call μόνο τα records, τις τιμές και το provenance που αλλάζουν την απόφαση.

Η ισχύς αυτής της διεπαφής εξαρτάται από το backbone. Το μοντέλο πρέπει να γράψει σωστά queries, να επιλέξει τη σωστή διάσταση και να γνωρίζει πότε το evidence είναι επαρκές. Το harness παρέχει ασφαλέστερα primitives, όχι αλάθητη κρίση.

Eviction χωρίς διαγραφή

Όταν η working view ξεπερνά το budget, το Scroll κάνει eviction. Προστατεύει το ενεργό turn, το πρόσφατο tail και τα νεότερα tool results. Στη συνέχεια διπλώνει πρώτα ολοκληρωμένα payloads σε pointers και, αν χρειάζεται, αφαιρεί παλαιότερα ολοκληρωμένα spans από την ορατή προβολή.

Η κρίσιμη εγγύηση είναι ότι η αφαίρεση αφορά μόνο τη view. Τα events παραμένουν αυτούσια στο Event Log και μπορούν να ανακτηθούν από το σταθερό seq. Για να μη βασίζεται η ανάκτηση μόνο σε keywords που ίσως ο agent δεν θυμάται, το Scroll κρατά eviction index με σύντομα headlines δεμένα σε ακριβή ranges.

Ο index είναι πολυεπίπεδος: οι πρόσφατες περιοχές διατηρούν μεγαλύτερη λεπτομέρεια και οι παλαιότερες συμπτύσσονται σε πιο χονδροειδή landmarks. Η εργασία περιγράφει λογαριθμική αύξηση των blocks ως προς τον αριθμό των evictions. Ο ρόλος του index είναι η πλοήγηση· το evidence παραμένει το πρωτότυπο event.

Τι ακριβώς αξιολογήθηκε

Το LongMemEval ελέγχει ανάκτηση και συλλογισμό πάνω σε παλιότερες συνομιλίες. Τα splits S και M περιλαμβάνουν περίπου 50 και 500 sessions, με ιστορίες περίπου 115K και 1,5 εκατ. tokens αντίστοιχα. Οι ερωτήσεις απαιτούν single-session retrieval, χρονικό συλλογισμό, ενημέρωση γνώσης ή σύνθεση evidence από πολλές συνεδρίες.

Το BEAM δημιουργεί συνεκτικές ιστορίες σε τέσσερις κλίμακες από 128K έως 10 εκατ. tokens και εξετάζει, μεταξύ άλλων, event ordering, contradiction resolution, knowledge update και aggregation. Το LOCA αξιολογεί agents που χρησιμοποιούν εργαλεία ενώ η περιγραφή της κατάστασης του περιβάλλοντος μεγαλώνει από 8K έως 256K tokens.

Το κύριο backbone ήταν το Qwen3.8-Max πάνω σε QwenPaw και Harbor. Η ομάδα χρησιμοποίησε κοινό system prompt και κανόνες context management, χωρίς few-shot demonstrations. LongMemEval και BEAM βαθμολογήθηκαν με benchmark-provided LLM judge, ενώ το LOCA χρησιμοποίησε rule-based verifier. Εκτός αν αναφέρεται διαφορετικά, κάθε task εκτελέστηκε μία φορά με random seed.

Τα βασικά αποτελέσματα του Scroll

Με Qwen3.8-Max, το Scroll πέτυχε 94,8% στο LongMemEval S, score 73,1 στο BEAM 10M και 86,7% accuracy στο LOCA 256K. Στο BEAM 10M ήταν 5,1 μονάδες πάνω από το καλύτερο δημοσιευμένο αποτέλεσμα που είχαν συγκεντρώσει οι συγγραφείς έως τις 15 Αυγούστου 2026, αλλά οι ίδιοι τονίζουν ότι τα reader models, budgets και evaluators διαφέρουν ανά σύστημα.

Scroll με Qwen3.8-Max

Τέσσερα τεκμηριωμένα σημεία αναφοράς

Οι τιμές προέρχονται από την εργασία και δεν αποτελούν υπόσχεση παραγωγικής απόδοσης, latency ή κόστους σε πραγματικό business workflow.

94,8%Accuracy στο LongMemEval S
73,1Judge score στο BEAM 10M
86,7%Accuracy στο LOCA 256K
105KMedian input tokens ανά BEAM 10M task, περίπου 1% του corpus

Πηγή: arXiv 2608.21690, κύρια αποτελέσματα και cost analysis.

Στο LongMemEval M, η συνολική ακρίβεια έπεσε από 94,8% σε 89,6%. Η μεγαλύτερη υποχώρηση εμφανίστηκε σε preference και knowledge-update ερωτήσεις, όπου τα περισσότερα distractor sessions αυξάνουν την πιθανότητα να βρεθεί ένα σχετικό record αλλά να χαθεί μέρος του αναγκαίου evidence. Αυτό είναι χρήσιμη υπενθύμιση ότι η πρόσβαση σε πλήρες ιστορικό δεν καταργεί το πρόβλημα της κάλυψης.

Γιατί η σύγκριση LOCA είναι πιο διαγνωστική

Στο LOCA, τέσσερις agent loops μοιράζονταν το ίδιο Qwen3.8-Max backbone και toolset και άλλαζε ο τρόπος διαχείρισης context. Στα 128K και 256K tokens, ο summarization agent πήγε από 86,7% σε 65,3% και ο retrieval agent από 88,0% σε 66,7%. Ο CodeAct agent πήγε από 89,3% σε 85,3%, ενώ το Scroll από 89,3% σε 86,7%.

Η πτώση ήταν επομένως 21,4 και 21,3 μονάδες για summarization και retrieval, έναντι 4,0 και 2,6 μονάδων για CodeAct και Scroll. Οι συγγραφείς αποδίδουν τη διαφορά στο ότι οι δύο programmatic προσεγγίσεις κρατούν intermediate results ως environment objects αντί να μεταφέρουν συνεχώς raw text στο context.

Η σύγκριση είναι περισσότερο ελεγχόμενη από τον πίνακα published memory systems, επειδή κρατά σταθερά backbone και toolset. Παραμένει όμως benchmark αποτέλεσμα, όχι απόδειξη ότι κάθε εφαρμογή customer support, analytics ή e-commerce θα έχει την ίδια βελτίωση.

Τι αποκαλύπτουν τα ablations

Η πιο έντονη πτώση εμφανίστηκε όταν οι πρωτότυπες εγγραφές αντικαταστάθηκαν κατά το ingestion από lossy summaries. Η παραλλαγή έπεσε σε συνολικό score 19,9 στο BEAM 10M, με σχεδόν μηδενικά αποτελέσματα σε κατηγορίες όπου απαιτούνταν ακριβείς τιμές, χρονικός συλλογισμός ή ενημέρωση γνώσης. Δεν αποδεικνύει ότι κάθε περίληψη αποτυγχάνει· δείχνει τον κίνδυνο να γίνει η περίληψη το μοναδικό αρχείο αλήθειας.

Χωρίς persistent REPL, το συνολικό αποτέλεσμα ήταν 7,3 μονάδες χαμηλότερο. Τα tool results δεν μπορούσαν πλέον να φιλτραριστούν, να ενωθούν και να συγκεντρωθούν μέσα στον kernel. Χωρίς eviction index, η πτώση ήταν 1,8 μονάδες συνολικά, αλλά μεγαλύτερη σε preference following, summarization και event ordering, όπου το evidence είναι διάσπαρτο.

Τα τρία στοιχεία λύνουν διαφορετικά προβλήματα: το Event Log διατηρεί το evidence, ο persistent kernel επιτρέπει computation πάνω του και ο eviction index βοηθά στην πλοήγηση όταν ο agent δεν γνωρίζει την ακριβή λέξη αναζήτησης. Η ποιότητα μιας μνήμης agent κρίνεται από ολόκληρη αυτή την αλυσίδα.

Κόστος: μικρότερη έκθεση, όχι μηδενικό context

Στο BEAM 10M, το median model input ανά task ήταν 105K tokens, περίπου 1% του corpus των 10 εκατ. tokens. Η ingestion δεν χρειάστηκε πρόσθετα LLM calls και τα records φιλτράρονταν στον Python kernel, ώστε στο context να περνά κυρίως το explicit print output.

Το 105K παραμένει μεγάλο input. Το Scroll δεν εξαφανίζει το κόστος και η εργασία δεν αναφέρει latency ή τιμή, επειδή εξαρτώνται από serving configuration. Σε πραγματική υλοποίηση πρέπει να μετρηθούν token exposure, p95 latency, αριθμός tool calls, συχνότητα επανάκτησης και κόστος αποθήκευσης μαζί με την τελική επιτυχία.

Η σωστή βελτιστοποίηση δεν είναι «όσο λιγότερα tokens γίνεται», αλλά «όσο context χρειάζεται για τεκμηριωμένη απόφαση». Η επιλεκτική ανάκτηση πρέπει να μειώνει το περιττό input χωρίς να κρύβει τις αποδείξεις που αλλάζουν το αποτέλεσμα.

Πού βοηθά σε πραγματικά business workflows

Σε analytics και marketing, ένας agent μπορεί να κρατά το ακριβές API response, το χρονικό σημείο και τον μετασχηματισμό που παρήγαγε ένα insight. Αν μια τιμή αλλάξει, συγκρίνει records με σωστή σειρά αντί να εμπιστεύεται μια περίληψη που ίσως συγχώνευσε παλιά και νέα δεδομένα.

Σε e-commerce, μεγάλοι κατάλογοι, exports παραγγελιών ή αποτελέσματα SEO crawling μπορούν να παραμένουν ως resident objects. Ο agent εμφανίζει μόνο τα προϊόντα, errors ή segments που στηρίζουν την τρέχουσα απόφαση. Αυτή είναι αρχιτεκτονική αναλογία, όχι workload που μέτρησε η εργασία.

Στο customer support, το πλήρες ιστορικό ενός case μπορεί να παραμένει στο audit trail, ενώ η working view περιλαμβάνει το ενεργό αίτημα, τις τελευταίες δεσμεύσεις και τα σχετικά policy records. Η σωστή εκκίνηση ενός AI agent από επιλεγμένη μνήμη και το Scroll λύνουν συμπληρωματικά προβλήματα: το πρώτο οργανώνει τι χρειάζεται στην αρχή, το δεύτερο πώς παραμένει ανακτήσιμη η πλήρης τροχιά.

Σε κάθε περίπτωση χρειάζονται access control, retention, redaction, tenant isolation και ανθρώπινη εποπτεία. Το paper περιγράφει fail-closed sandbox και δηλωμένες capabilities, αλλά δεν αποτελεί πλήρη enterprise security ή compliance αξιολόγηση. Η παραγωγική ασφάλεια ανήκει στο συνολικό AI harness και στη διακυβέρνηση της αρχιτεκτονικής, όχι μόνο στον μηχανισμό μνήμης.

Επτά βήματα για μνήμη agent στην παραγωγή

Η υιοθέτηση της αρχής του Scroll δεν απαιτεί τυφλή αντιγραφή του framework. Απαιτεί να μετατραπεί η μνήμη από ασαφές ιστορικό συνομιλίας σε ελέγξιμο data plane με σαφή όρια.

Επτά έλεγχοι για ανθεκτικό context management

  1. Стъпка 1Ορίστε το πρωτότυπο record

    Καταγράψτε ποια μηνύματα, tool calls, payloads και artifacts αποτελούν το αμετάβλητο evidence και ποια παράγωγα μπορούν να αναδημιουργηθούν.

  2. Стъпка 2Δώστε σταθερές διευθύνσεις και provenance

    Κάθε απόφαση πρέπει να μπορεί να δείξει στα ακριβή events, timestamps, εκδόσεις και μετασχηματισμούς που τη στηρίζουν.

  3. Стъпка 3Κρατήστε summaries ως indexes

    Χρησιμοποιήστε περιλήψεις, embeddings και headlines για πλοήγηση, χωρίς να επιτρέπετε να διαγράψουν ή να αντικαταστήσουν το πρωτότυπο ιστορικό.

  4. Стъпка 4Μεταφέρετε το computation εκτός prompt

    Εκτελέστε filters, joins, deduplication και aggregations σε ελεγχόμενο runtime και επιστρέψτε στο μοντέλο μόνο το μικρό τεκμηριωμένο projection.

  5. Стъпка 5Κλειδώστε capabilities και δεδομένα

    Περιορίστε database, filesystem, network και tools ανά ρόλο, με tenant isolation, read-only history, redaction και retention policy.

  6. Стъпка 6Μετρήστε την ανάκτηση, όχι μόνο την απάντηση

    Παρακολουθήστε χαμένες αποδείξεις, λάθος χρονική σειρά, execution errors, premature stopping και μη τεκμηριωμένα συμπεράσματα ανά τύπο task.

  7. Стъпка 7Δοκιμάστε το πραγματικό μήκος της ροής

    Χρησιμοποιήστε sessions, tool outputs, concurrency και failure modes που μοιάζουν με την παραγωγή, με shadow mode, ανθρώπινο review και rollback πριν από κλιμάκωση.

Η αναζήτηση πρέπει επίσης να είναι field-aware. Ένα semantic match δεν αρκεί όταν το κρίσιμο πεδίο είναι ημερομηνία, έκδοση, πελάτης ή status. Η προσέγγιση του field-aware RAG για AI agents βοηθά να δρομολογείται κάθε query στα σωστά δεδομένα, ενώ το lossless log διατηρεί την αρχική απόδειξη.

Όρια της μελέτης και πρακτικό συμπέρασμα

Τα αποτελέσματα βασίζονται σε συγκεκριμένα benchmarks, ένα κύριο backbone και συνήθως μία εκτέλεση ανά task. Το LongMemEval και το BEAM χρησιμοποιούν LLM judge, ενώ οι συγκρίσεις με άλλα memory systems δεν αναπαράχθηκαν σε ενιαίο setup. Η επίδοση διαφέρει έντονα ανά backbone: στο LOCA 256K το εύρος των έξι μοντέλων ήταν 86,7% έως 22,7%.

Το Scroll επίσης δεν απαντά μόνο του σε privacy, compliance, incident response ή data lifecycle. Το NIST AI RMF ζητά governance, χαρτογράφηση κινδύνων, μέτρηση και συνεχή διαχείριση. Για μια production μνήμη αυτά μεταφράζονται σε access logs, data minimization, retention, ελέγχους εξουσιοδότησης και ανθρώπινη ευθύνη για κρίσιμες αποφάσεις.

Το πρακτικό συμπέρασμα είναι καθαρό: μην αναγκάζετε τον agent να διαλέξει ανάμεσα σε άπειρο prompt και λήθη. Διατηρήστε το πλήρες, ελέγξιμο record εκτός context, δώστε προγραμματιστική πρόσβαση με περιορισμένες capabilities και απαιτήστε κάθε σημαντικό συμπέρασμα να επιστρέφει μαζί με το evidence που το στηρίζει.

Από τη μνήμη του agent σε ελεγχόμενη επιχειρησιακή ροή

Σχεδιάστε AI αυτοματισμούς με provenance, permissions και μετρήσιμο context

Η TWO DOTS χαρτογραφεί δεδομένα, εργαλεία, retention, human handoffs και acceptance criteria ώστε ένας AI agent να θυμάται ό,τι χρειάζεται χωρίς να κρύβει την πηγή, την έκδοση ή το όριο της απόφασής του.

Често задавани въпроси

Τι είναι το Scroll για AI agents;

Είναι ερευνητικός context manager που αντιμετωπίζει τη συνεδρία ως εκτελέσιμο περιβάλλον με append-only Event Log, durable storage και persistent Python kernel. Ο agent ανακτά και επεξεργάζεται το ιστορικό με κώδικα.

Καταργεί το Scroll το context window;

Όχι. Κάθε model call εξακολουθεί να έχει περιορισμένη working view. Το Scroll κρατά το πλήρες state εκτός του παραθύρου και επιλέγει προγραμματιστικά ποιο projection θα εμφανιστεί στην επόμενη κλήση.

Γιατί δεν αρκεί μια καλή περίληψη;

Επειδή δημιουργείται πριν γίνουν γνωστές οι μελλοντικές ανάγκες. Αν αντικαταστήσει το πρωτότυπο, μπορεί να χάσει ακριβή τιμή, εξαίρεση, χρονική σειρά ή provenance που αργότερα θα είναι κρίσιμα.

Τι σημαίνει ότι μόνο το print μπαίνει στο context;

Οι μεταβλητές, τα tool results και οι ενδιάμεσοι υπολογισμοί παραμένουν στον persistent kernel. Μόνο το κείμενο που εκτυπώνει ρητά ο agent γίνεται bounded observation για το επόμενο model call.

Πώς ανακτά το Scroll περιεχόμενο που έχει γίνει eviction;

Τα events παραμένουν αυτούσια στο Event Log με σταθερές διευθύνσεις seq. Ο agent χρησιμοποιεί BM25, structured filters, expand σε συγκεκριμένα ranges και έναν tiered eviction index με address-anchored headlines.

Ποια ήταν τα βασικά αποτελέσματα της εργασίας;

Με Qwen3.8-Max αναφέρθηκαν 94,8% στο LongMemEval S, score 73,1 στο BEAM 10M και 86,7% στο LOCA 256K. Είναι benchmark αποτελέσματα της συγκεκριμένης ρύθμισης, όχι εγγύηση παραγωγικής απόδοσης.

Ποιος είναι ο βασικός κίνδυνος της προσέγγισης;

Το μοντέλο μπορεί να γράψει λάθος query, να αναζητήσει σε λάθος διάσταση ή να σταματήσει πριν συγκεντρώσει αρκετές αποδείξεις. Το lossless ιστορικό επιτρέπει ανάκτηση, αλλά δεν εγγυάται σωστή χρήση του.

Τι πρέπει να κρατήσει μια επιχείρηση από το Scroll;

Να διαχωρίζει το audit-grade ιστορικό από το ενεργό prompt, να κρατά provenance, να εκτελεί computation εκτός context, να περιορίζει permissions και να αξιολογεί την ανάκτηση σε πραγματικές μακροχρόνιες ροές.

Информационен бюлетин

Въведете имейл адреса си по-долу, за да се абонирате за нашия бюлетин