Με πάνω από 20 χρόνια εμπειρίας, μεταμορφώνουμε την ψηφιακή σας παρουσία. Εξειδικευόμαστε στην κατασκευή ιστοσελίδων και E-Shop, το SEO και το Digital Marketing, τα ERP λογισμικά και τους έξυπνους αυτοματισμούς που απογειώνουν την επιχείρησή σας.
Το HIRA κρατά τις εύκολες ταξινομήσεις στο retrieval και στέλνει μόνο την πραγματική αβεβαιότητα σε LLM και άνθρωπο.
Απάντηση πρώτα: το HIRA μειώνει τις περιττές LLM κλήσεις επειδή δεν στέλνει κάθε έγγραφο στο ακριβότερο μοντέλο. Κλείνει τις καθαρές περιπτώσεις με συνδυασμό OCR, σημασιολογικής και οπτικής ανάκτησης, χρησιμοποιεί τοπικό LLM μόνο όταν η πρώτη απόφαση δεν είναι αρκετά ισχυρή και ζητά άνθρωπο όταν παραμένει ουσιαστική αβεβαιότητα.
Η προσέγγιση είναι ιδιαίτερα ενδιαφέρουσα για τράπεζες, ασφαλιστικές, νομικά τμήματα και back offices με εμπιστευτικά έγγραφα, λίγα αρχικά labels και περιορισμένη δυνατότητα review. Τα αποτελέσματα είναι ισχυρά, αλλά ανήκουν σε ένα διορθωμένο δημόσιο benchmark και ένα ιδιωτικό corpus trade finance. Δείχνουν τι μπορεί να πετύχει η αρχιτεκτονική όταν βαθμονομηθεί σωστά· δεν αποτελούν εγγύηση για κάθε εταιρικό dataset.
Το HIRA, Human-in-the-Loop Retrieval-Augmented Cascade, είναι μια training-free αρχιτεκτονική ταξινόμησης εγγράφων. Αντί να εκπαιδεύει ξανά έναν classifier κάθε φορά που αλλάζουν τα templates ή η ταξινομία, συνδυάζει retrieval, τοπική επαλήθευση από LLM και επιλεκτικό ανθρώπινο review. Τα βάρη του μοντέλου παραμένουν σταθερά· αυτό που εξελίσσεται είναι το index παραδειγμάτων και ένας γράφος των συχνών συγχύσεων.
Η διαφορά από ένα γενικό RAG workflow είναι ο σαφής μηχανισμός δρομολόγησης. Το σύστημα δεν ανακτά απλώς context για να γράψει απάντηση. Επιλέγει κατηγορία, μετρά αν η απόφαση περνά ένα βαθμονομημένο όριο και κλιμακώνει μόνο όταν το προηγούμενο επίπεδο δεν αρκεί. Για οργανισμούς που ήδη εξετάζουν Document AI για επιχειρησιακά έγγραφα, αυτή η αρχιτεκτονική μεταφέρει το βάρος από το «ποιο μοντέλο είναι μεγαλύτερο;» στο «ποια αβεβαιότητα αξίζει επιπλέον compute ή ανθρώπινο χρόνο;».
Το επιχειρησιακό πρόβλημα πίσω από την ταξινόμηση εγγράφων
Η κλασική συνταγή απαιτεί αρκετά επισημασμένα έγγραφα, εκπαίδευση layout-aware μοντέλου και νέο κύκλο fine-tuning όταν αλλάξει η ταξινομία. Σε ρυθμιζόμενους κλάδους, όμως, τα έγγραφα μπορεί να μην επιτρέπεται να φύγουν από την υποδομή, τα cold-start labels να είναι ελάχιστα και κάθε αλλαγή βαρών να απαιτεί νέα επικύρωση, risk review και έγκριση.
Υπάρχει και δεύτερος περιορισμός: η ανθρώπινη επισήμανση είναι συνήθως ακριβότερη και πιο αργή από το inference. Οι κατηγορίες μπορεί να είναι μακράς ουράς ή σχεδόν συνώνυμες, όπως διαφορετικοί τύποι invoice και certificate που μοιράζονται το μεγαλύτερο μέρος του κειμένου. Η σωστή βελτιστοποίηση δεν είναι απλώς υψηλό συνολικό accuracy. Είναι υψηλότερη ποιότητα ανά ανθρώπινη διόρθωση, μαζί με σαφή παρακολούθηση των σπάνιων κατηγοριών.
Γι’ αυτό ένα production σύστημα χρειάζεται περισσότερα από καλό OCR. Χρειάζεται versioned taxonomy, μετρήσιμο validation set, καταγραφή των overrides και μηχανισμό που να μετατρέπει τις διορθώσεις σε αξιοποιήσιμη μνήμη. Η ίδια αρχή εμφανίζεται και σε AI agents για εταιρικά έγγραφα: η δομή της ανάγνωσης και το audit trail είναι εξίσου σημαντικά με την τελική πρόβλεψη.
Τα τρία επίπεδα απόφασης του HIRA
Το HIRA οργανώνει την ταξινόμηση ως cascade. Κάθε έγγραφο ξεκινά από το φθηνότερο επίπεδο και προχωρά μόνο αν δεν ικανοποιεί τον κανόνα αποδοχής. Έτσι το compute και ο ανθρώπινος χρόνος κατευθύνονται στις περιπτώσεις με πραγματική πληροφοριακή αξία.
Tier 1 — Retrieval
BM25, MiniLM και SigLIP2 ψηφίζουν μέσω weighted reciprocal-rank fusion. Αν η κορυφαία κατηγορία περάσει το βαθμονομημένο όριο, η ταξινόμηση ολοκληρώνεται χωρίς LLM.
Χαμηλό κόστοςΓρήγορη έξοδος
Tier 2 — LLM verifier
Το τοπικό LLM βλέπει OCR, κορυφαία παραδείγματα, περιγραφές labels και όρους που ξεχωρίζουν γνωστά confusion pairs. Ελέγχει αντί να ταξινομεί όλο το stream από το μηδέν.
Contrastive έλεγχοςOn-premises
Tier 3 — Human review
Όταν η επαλήθευση δεν περνά τον κανόνα αποδοχής, η περίπτωση μπαίνει σε ουρά. Η διόρθωση αποθηκεύεται ως exemplar και ενημερώνει τον confusion graph.
Στοχευμένο reviewΜόνιμη μάθηση
Κανόνας δρομολόγησης
Μην χρησιμοποιείτε ένα ενιαίο confidence threshold για κάθε κατηγορία και κάθε συνέπεια λάθους
Βαθμονομήστε το Tier 1 και το Tier 2 σε δικά σας validation δεδομένα, παρακολουθήστε head, medium και tail κατηγορίες και συνδέστε το escalation με το επιχειρησιακό κόστος του λάθους. Ένα τιμολόγιο χαμηλού ρίσκου και ένα έγγραφο κανονιστικής συμμόρφωσης δεν χρειάζονται αναγκαστικά τον ίδιο κανόνα αποδοχής.
Γιατί συνδυάζει τρεις μορφές retrieval
Κάθε retriever καλύπτει διαφορετική αδυναμία. Το BM25 βρίσκει ακριβείς όρους και φράσεις στο OCR. Το all-MiniLM-L6-v2 εντοπίζει σημασιολογικά συγγενές κείμενο όταν οι λέξεις αλλάζουν. Το SigLIP2 αξιοποιεί την οπτική μορφή, τη διάταξη και το template του εγγράφου. Οι τρεις λίστες ενώνονται με weighted reciprocal-rank fusion, με βάρη που βαθμονομούνται στο validation split της εγκατάστασης.
Η σύνθεση δεν σημαίνει ότι κάθε modality είναι πάντα χρήσιμο. Στο corrected Tobacco-3482, το SigLIP2 μόνο του έφτασε Macro-F1 0,7718 και το RRF 0,7736, ενώ τα text-only retrievers ήταν χαμηλότερα. Στο δυσκολότερο Financial-80, όμως, το RRF έφτασε 0,502 έναντι 0,391 του καλύτερου single retriever. Το συμπέρασμα δεν είναι «πάντα τρία μοντέλα», αλλά «μετρήστε ποια σήματα προσφέρουν ανεξάρτητη αξία στη δική σας ταξινομία».
Το LLM δεν λειτουργεί ως μοναδικός zero-shot classifier. Ενεργοποιείται μόνο όταν το Tier 1 δεν είναι αρκετά βέβαιο και εκτελεί contrastive verification πάνω στις υποψήφιες κατηγορίες. Στη μελέτη αξιολογήθηκαν DeepSeek-R1-Distill-Qwen-32B, Qwen-VL2.5 και Llama-3.1-8B. Στη seed-only κατάσταση το DeepSeek είχε το υψηλότερο Macro-F1, 0,8819, και ήταν ταχύτερο ανά έγγραφο στο ίδιο A100, οπότε χρησιμοποιήθηκε στα επόμενα πειράματα.
Η εγκατάσταση ήταν τοπική, με vLLM σε μία A100 και πρόσβαση μέσω εσωτερικού δικτύου. Οι συγγραφείς αναφέρουν ότι κανένα document, retrieval snippet ή prompt δεν έφυγε από το deployment environment. Αυτό δείχνει μια βιώσιμη τεχνική επιλογή για data residency, όχι αυτόματη απόδειξη ασφάλειας. Ο οργανισμός εξακολουθεί να χρειάζεται access control, logging, patching, model provenance και πολιτική retention. Η ίδια διάκριση είναι κρίσιμη όταν εξετάζεται ιδιωτική υποδομή για enterprise RAG.
EDRM: όταν κάθε διόρθωση γίνεται λειτουργική μνήμη
Η Evolving Document Relevance Memory, ή EDRM, μετατρέπει το human review σε παραγωγικό asset χωρίς αλλαγή βαρών. Κάθε διόρθωση μπαίνει στο retrieval index ως νέο exemplar. Το βάρος της σχετίζεται με το margin της λανθασμένης πρόβλεψης, ώστε μια δύσκολη οριακή περίπτωση να επηρεάζει διαφορετικά το σύστημα από μια ξεκάθαρη αστοχία.
Παράλληλα ενημερώνεται ένας Dirichlet-smoothed confusion graph. Ο γράφος καταγράφει ποια ζεύγη κατηγοριών μπερδεύονται και τροφοδοτεί τον verifier με distinguishing terms όταν εμφανιστεί ξανά παρόμοιο ζεύγος. Στο Tier-1 ablation του Tobacco-3482, η απλή εισαγωγή διορθώσεων με βάρος 1,0 έφτασε Macro-F1 0,8857, ενώ η margin-weighted EDRM εκδοχή 0,9135 — διαφορά 2,78 ποσοστιαίων μονάδων, κυρίως στις μεσαίες κατηγορίες.
Αυτή η μνήμη χρειάζεται διακυβέρνηση. Πρέπει να είναι γνωστό ποιος έκανε τη διόρθωση, με ποια έκδοση taxonomy, ποια exemplars έχουν λήξει και πώς ανακαλείται μια λανθασμένη ετικέτα. Όπως και σε ένα audit trail που ενώνει απομονωμένα δεδομένα, η αξία δεν βρίσκεται μόνο στην αποθήκευση αλλά στην προέλευση, την έκδοση και τη δυνατότητα ελέγχου.
Τι έδειξε το corrected Tobacco-3482
Το διορθωμένο benchmark περιλάμβανε 2.737 έγγραφα σε δέκα κατηγορίες, αφού αφαιρέθηκαν multi-label ή κενές εγγραφές από το αρχικό corpus. Για την καμπύλη HITL, 100 έγγραφα —δέκα ανά κατηγορία— αρχικοποίησαν το index, 2.086 μπήκαν ως pool σταθερής σειράς και 279 κρατήθηκαν για test.
Με 518 ανθρώπινες διορθώσεις, δηλαδή 24,8% του pool, το πλήρες HIRA έφτασε Macro-F1 0,9423. Η ίδια Macro-F1 καταγράφηκε για το fully labelled pool oracle, όπου και τα 2.086 pool documents είχαν εισαχθεί με ground-truth labels. Αυτό δεν σημαίνει ότι οι δύο λύσεις ήταν ίδιες σε κάθε metric: το oracle είχε accuracy 0,9462 έναντι 0,9355 του HIRA, ενώ σε ίσο annotation budget το DiT-618 είχε υψηλότερο tail-F1, 0,978 έναντι 0,970.
HIRA σε τέσσερις τεκμηριωμένες μετρήσεις
Λιγότερες κλήσεις, στοχευμένο review και dataset-specific κέρδη
Οι αριθμοί αφορούν τα συγκεκριμένα πειράματα της εργασίας. Δεν είναι πρόβλεψη κόστους ή ακρίβειας για νέο deployment χωρίς δικό του validation.
≈60%Λιγότερες LLM κλήσεις στο corrected Tobacco-3482 έναντι verifier σε κάθε έγγραφο
0,9423Macro-F1 στο Tobacco-3482 μετά από 518 ανθρώπινες διορθώσεις
6,4%Του Financial-80 stream οδηγήθηκε σε ανθρώπινη διόρθωση
+23,3Ποσοστιαίες μονάδες Macro-F1 έναντι του DeepSeek zero-shot baseline στο Financial-80
Πηγή: HIRA, arXiv 2608.21792, Sections 6–7 και Tables 2, 4 και 7.
Η εικόνα στο production corpus Financial-80
Το Financial-80 περιείχε 32.911 έγγραφα σε 80 εμπιστευτικές κατηγορίες. Το index ξεκίνησε με 648 seed documents, 316 χρησιμοποιήθηκαν για validation, 1.714 για test και 30.233 ως εισερχόμενο pool. Επειδή το corpus είναι ιδιωτικό, δεν δημοσιεύονται ονόματα κατηγοριών ή per-class πίνακες. Αυτό περιορίζει την ανεξάρτητη αναπαραγωγή, παρότι οι aggregate μετρικές και το πρωτόκολλο περιγράφονται.
Μετά την επεξεργασία όλου του stream, το σύστημα ζήτησε 1.945 ανθρώπινες διορθώσεις, δηλαδή 6,4%. Το Macro-F1 αυξήθηκε από 0,6218 του DeepSeek zero-shot baseline σε μέσο 0,8548 στο τελικό checkpoint. Σε τρία runs οι τιμές ήταν 0,8523, 0,8535 και 0,8586. Οι συγγραφείς αναφέρουν ότι οι διορθώσεις χρειάστηκαν περίπου έξι εργάσιμες ημέρες ενός reviewer, ενώ η δυναμική queue rate έπεσε από περίπου 18,8% στην αρχή σε 6,2%.
Το αποτέλεσμα είναι λειτουργικά ενδιαφέρον επειδή ο βασικός περιορισμός ήταν η χωρητικότητα review, όχι η GPU. Ωστόσο, το «έξι ημέρες» δεν πρέπει να μεταφραστεί σε έτοιμο ROI για άλλη επιχείρηση. Ο χρόνος εξαρτάται από πολυπλοκότητα εγγράφων, εξειδίκευση reviewer, ποιότητα OCR, interface, taxonomy και συνέπεια των labels.
Thresholds, confidence και calibration
Η deployed V3 ρύθμιση χρησιμοποίησε Tier-1 threshold 0,675, Tier-2 threshold 0,95 και index-decay parameter 104. Το πρώτο threshold επιλέχθηκε από sweep στο validation split. Σε υψηλότερα Tier-1 thresholds εμφανίστηκε ένα false cliff: περισσότερα έγγραφα οδηγούνταν στο ακριβότερο Tier 2 χωρίς αντίστοιχο κέρδος ποιότητας. Στο ώριμο index, ο βασικός μοχλός του human-review volume ήταν το Tier-2 accept threshold.
Η μελέτη κατέγραψε επίσης πρόβλημα με numeric confidence από μικρότερα open-weight LLMs: οι τιμές συγκεντρώνονταν στο εμφανές gate 0,950. Η αντικατάσταση της αριθμητικής τιμής με ordinal enum πέντε επιπέδων έδωσε πιο χρήσιμη διασπορά. Είναι υπενθύμιση ότι το self-reported confidence ενός μοντέλου δεν είναι από μόνο του probability calibration.
Το index decay δεν έχει καθολική σωστή τιμή. Σε στατικό benchmark βοηθά να μένουν τα exemplars για μεγάλο διάστημα. Σε παραγωγή με drift χρειάζεται μηχανισμός που αποσύρει παλιά templates ή κατηγορίες. Η απόφαση για escalation πρέπει να ακολουθεί το ίδιο πνεύμα με το πότε ένα AI πρέπει να ζητά διευκρίνιση αντί να απαντά: μετρημένο utility και γνωστό κόστος λάθους, όχι αυθαίρετη βεβαιότητα.
Τι σημαίνει για μια επιχείρηση
Η πιο χρήσιμη ιδέα του HIRA είναι η κλιμάκωση κατά αβεβαιότητα. Οι εύκολες περιπτώσεις δεν χρειάζεται να πληρώνουν το latency και το compute ενός μεγάλου verifier. Οι δύσκολες περιπτώσεις δεν πρέπει να κρύβονται πίσω από ένα συνολικό accuracy. Μπορούν να δρομολογούνται με σαφή κανόνα, και οι ανθρώπινες διορθώσεις να μετατρέπονται σε ανακτήσιμα precedents.
Η λογική μπορεί να εξεταστεί σε παραστατικά προμηθευτών, claims, αιτήματα επιστροφής, συμβάσεις ή support attachments. Πρόκειται για πιθανές εφαρμογές που συνάγονται από την αρχιτεκτονική, όχι για deployments που αξιολογήθηκαν στην εργασία. Κάθε χρήση χρειάζεται δικό της validation set, confusion analysis, μέτρηση queue capacity και ξεχωριστή παρακολούθηση head και tail επιδόσεων.
Η τεχνική αρχιτεκτονική πρέπει να ενταχθεί σε ευρύτερο operating model: ιδιοκτησία taxonomy, δικαιώματα αλλαγής thresholds, πολιτική override, παρακολούθηση drift και διαδικασία incident review. Αυτή είναι η πρακτική γέφυρα προς enterprise AI governance ως μέρος της αρχιτεκτονικής, όχι ως έλεγχο που προστίθεται μετά την παραγωγή.
Επτά βήματα για ένα ασφαλές pilot
Pilot HIRA με μετρήσιμη αξία και ελεγχόμενο ρίσκο
Βήμα 1Περιορίστε το πρώτο workflow
Επιλέξτε μία σαφή οικογένεια εγγράφων και συγκεκριμένη downstream ενέργεια, χωρίς να αναμείξετε από την αρχή όλο το εταιρικό αρχείο.
Βήμα 2Καθαρίστε taxonomy και labels
Ορίστε αμοιβαία κατανοητές κατηγορίες, χειρισμό multi-label περιπτώσεων και κανόνες για άγνωστα ή μη ταξινομήσιμα έγγραφα.
Βήμα 3Χτίστε αντιπροσωπευτικό validation set
Συμπεριλάβετε head, medium και tail κατηγορίες, δύσκολα confusion pairs, διαφορετικά templates και ρεαλιστικά OCR σφάλματα.
Βήμα 4Μετρήστε κάθε retrieval σήμα χωριστά
Συγκρίνετε BM25, dense text και image embeddings πριν ορίσετε τα RRF βάρη. Αφαιρέστε modality που δεν προσθέτει ανεξάρτητη αξία.
Βήμα 5Βαθμονομήστε τα δύο gates
Επιλέξτε Tier-1 και Tier-2 thresholds με καμπύλες ποιότητας, verifier calls και ανθρώπινου queue, όχι με αντιγραφή των 0,675 και 0,95 της μελέτης.
Βήμα 6Τρέξτε shadow mode και ελέγξτε τις διορθώσεις
Μην αφήσετε το σύστημα να ενεργεί αυτόματα. Μετρήστε disagreement, χρόνο review, consistency μεταξύ reviewers και επίδραση κάθε exemplar πριν ενημερώνεται η μνήμη.
Βήμα 7Ορίστε production SLO και rollback
Καταγράψτε όρια για queue rate, Macro-F1, tail-F1, latency και drift, καθώς και ποιος παγώνει το index ή επαναφέρει προηγούμενη taxonomy όταν οι δείκτες υποχωρούν.
Τα όρια και το πρακτικό συμπέρασμα
Η ισχυρότερη παραγωγική απόδειξη βασίζεται σε ιδιωτικό dataset, οπότε τρίτοι δεν μπορούν να αναπαράγουν τις λεπτομέρειες των 80 κατηγοριών. Η εργασία δεν συγκρίνει πλήρως επιβλεπόμενο LayoutLMv3 στο Financial-80, επειδή το αντίστοιχο labelled training set δεν υπήρχε στους περιορισμούς του deployment. Αυτή είναι εύλογη πειραματική επιλογή, αλλά αφήνει ανοιχτή τη σύγκριση όταν ένας οργανισμός διαθέτει ήδη πολλά ποιοτικά labels.
Τα κύρια trajectories χρησιμοποιούν fixed seed, με τριπλό run μόνο στο τελικό Financial-80 checkpoint λόγω υπολογιστικού κόστους. Η απόδοση εξαρτάται από OCR, embeddings, threshold calibration, hardware, taxonomy drift και ποιότητα ανθρώπινων διορθώσεων. Το HIRA δεν καταργεί αυτές τις μεταβλητές· προσφέρει έναν καθαρό τρόπο να τις κάνει ορατές και να κατευθύνει τον ακριβό έλεγχο εκεί όπου έχει μεγαλύτερη αξία.
Για μια επιχείρηση, το σωστό takeaway δεν είναι να αντιγράψει τα thresholds ή το μοντέλο της μελέτης. Είναι να δοκιμάσει αν μια πολυεπίπεδη ροή retrieval → verifier → άνθρωπος μπορεί να μειώσει μετρήσιμα τις περιττές LLM κλήσεις χωρίς να κρύψει τα δύσκολα έγγραφα. Το pilot αξίζει μόνο όταν το validation, το review capacity και το audit trail σχεδιαστούν μαζί.
Από το έγγραφο στην ελεγχόμενη απόφαση
Σχεδιάστε document automation που κλιμακώνει μόνο την πραγματική αβεβαιότητα
Η TWO DOTS χαρτογραφεί OCR, retrieval, τοπικό LLM verification και human review πάνω στις δικές σας κατηγορίες εγγράφων, με validation set, thresholds, audit trail και rollback πριν η ροή συνδεθεί με παραγωγικές ενέργειες.
Είναι μια training-free, retrieval-augmented cascade για ταξινόμηση εγγράφων. Συνδυάζει τρεις retrievers, τοπικό LLM verifier και επιλεκτικό human review, χωρίς να αλλάζει τα βάρη του μοντέλου.
Χρειάζεται cloud LLM;
Όχι στη μελέτη. Ο verifier φιλοξενήθηκε τοπικά με vLLM σε μία A100 και οι συγγραφείς αναφέρουν ότι έγγραφα, snippets και prompts παρέμειναν στο deployment environment.
Ποια retrieval σήματα συνδυάζει;
BM25 πάνω σε OCR κείμενο, all-MiniLM-L6-v2 για dense text embeddings και SigLIP2 για image embeddings, με validation-calibrated weighted reciprocal-rank fusion.
Πώς βελτιώνεται χωρίς fine-tuning;
Κάθε ανθρώπινη διόρθωση προστίθεται ως margin-weighted exemplar και ενημερώνει έναν Dirichlet-smoothed confusion graph που βοηθά μελλοντικές παρόμοιες αποφάσεις.
Πόσο human review χρειάστηκε στο Financial-80;
Το HIRA ζήτησε 1.945 διορθώσεις από stream 30.233 εγγράφων, δηλαδή 6,4%, στο τελικό αξιολογημένο checkpoint του ιδιωτικού corpus.
Πόσο μειώθηκαν οι LLM κλήσεις;
Στο corrected Tobacco-3482 περίπου 40% των εγγράφων έφτανε στον verifier, άρα οι κλήσεις ήταν περίπου 60% λιγότερες από μια zero-shot ροή που καλεί LLM για κάθε έγγραφο.
Μπορεί μια επιχείρηση να αντιγράψει τα thresholds της μελέτης;
Όχι με ασφάλεια. Τα Tier-1 και Tier-2 thresholds πρέπει να βαθμονομηθούν σε αντιπροσωπευτικό validation set και να συνδεθούν με το κόστος λάθους και τη διαθέσιμη χωρητικότητα review.
Εξαλείφει το HIRA το AI governance;
Όχι. Αποφεύγει συχνές αλλαγές βαρών, αλλά taxonomy, retrieval memory, confusion graph, thresholds, corrections και audit trail παραμένουν παραγωγικά assets που χρειάζονται συνεχή διακυβέρνηση.