Το BEST-KAG δείχνει πώς ένα σύστημα AI μπορεί να απαντά πάνω σε σύνθετα πρότυπα χωρίς να χάνει την ακριβή διάταξη, τον πίνακα ή τον τύπο που στηρίζει την απάντηση.
Η ουσία δεν είναι να δοθεί περισσότερο κείμενο στο μοντέλο. Είναι να οργανωθεί η γνώση ως ιχνηλάσιμη αλυσίδα, να ανακτηθεί μόνο το αναγκαίο evidence και να δοκιμαστεί κάθε μοντέλο πάνω στις ίδιες ερωτήσεις. Για μια επιχείρηση, αυτό μετατρέπει την «έξυπνη αναζήτηση» σε πρόβλημα αρχιτεκτονικής, ποιότητας δεδομένων και ελέγχου.
Τι είναι το BEST-KAG και ποιο πρόβλημα λύνει
Το BEST-KAG είναι ερευνητικό πλαίσιο Knowledge-Augmented Generation για ερωταπαντήσεις πάνω σε πρότυπα κτιριακής μηχανικής. Οι Jia-Rui Lin, Junxi Guo, Keyin Chen και Peng Pan συνδυάζουν πολυτροπικό γράφο γνώσης, υβριδική εξαγωγή με κανόνες και LLM, αναζήτηση πάνω στον γράφο και παραγωγή απάντησης με τεκμήρια σε επίπεδο διάταξης.
Το πρόβλημα είναι συγκεκριμένο. Μια πειστική απάντηση για έναν τεχνικό κανόνα δεν αρκεί όταν ο χρήστης πρέπει να γνωρίζει ποια διάταξη ισχύει, ποια εξαίρεση την περιορίζει και ποιος πίνακας ή μαθηματικός τύπος δίνει την τιμή. Η εργασία επιχειρεί να διατηρήσει αυτή την αποδεικτική αλυσίδα από το έγγραφο μέχρι την τελική απάντηση.
Η ερευνητική βάση καλύπτει 251 πρότυπα και οργανώνει το περιεχόμενό τους σε 171.652 κόμβους και 310.914 ακμές. Οι αριθμοί περιγράφουν το συγκεκριμένο corpus και τη συγκεκριμένη μοντελοποίηση· δεν είναι γενικός στόχος μεγέθους για κάθε εταιρική βάση γνώσης.
Τέσσερα τεκμηριωμένα μεγέθη του BEST-KAG
Οι τιμές προέρχονται από την πρωτογενή εργασία και περιγράφουν το corpus και το benchmark. Δεν αποτελούν ποσοστά επιτυχίας ή εγγύηση παραγωγικής απόδοσης.
251
πρότυπα
Τα πρότυπα κτιριακής μηχανικής που εντάχθηκαν στη βάση γνώσης της μελέτης.
171.652
κόμβοι
Οι δομικές, σημασιολογικές και πολυτροπικές μονάδες του συγκεκριμένου γράφου.
310.914
ακμές
Οι ιεραρχικές, παραπεμπτικές και σημασιολογικές σχέσεις μεταξύ των κόμβων.
140
ερωτήσεις
Τα ζεύγη ερώτησης-απάντησης του benchmark, μοιρασμένα σε επτά κατηγορίες.
Γιατί δεν αρκεί ένα απλό RAG πάνω σε PDF
Η συμβατική αναζήτηση σε πρότυπα ξεκινά από λέξεις-κλειδιά. Ο μηχανικός βρίσκει πιθανές διατάξεις, ακολουθεί παραπομπές, ελέγχει εξαιρέσεις και μεταφράζει τη νομικοτεχνική διατύπωση σε απόφαση. Η διαδικασία δυσκολεύει όταν η ερώτηση χρησιμοποιεί άλλο λεξιλόγιο ή όταν η απάντηση μοιράζεται σε πολλές ενότητες.
Ένα απλό RAG βελτιώνει την πρόσβαση, αλλά το chunking μπορεί να χωρίσει μια απαίτηση από την προϋπόθεση, τον ορισμό ή τον πίνακά της. Η vector similarity βρίσκει σημασιολογικά κοντινό κείμενο· δεν αποδεικνύει από μόνη της ότι διατηρήθηκε η κανονιστική σχέση. Αυτός είναι ο λόγος που ένα οργανωμένο knowledge base για ομάδες και πελάτες χρειάζεται σαφή δομή, εκδόσεις και ownership, όχι μόνο ένα πεδίο αναζήτησης.
Απλή ανάκτηση και ιχνηλάσιμο KAG λύνουν διαφορετικό πρόβλημα
Τι διατηρεί ο πολυτροπικός γράφος γνώσης
Στο επίπεδο εγγράφου, κάθε πρότυπο γίνεται ρίζα με κόμβους κεφαλαίων, ενοτήτων, διατάξεων και παραγράφων. Σχέσεις όπως hasChapter, hasSection, hasClause και hasParagraph διατηρούν τη θέση κάθε μονάδας μέσα στο πρωτότυπο. Η hasReference συνδέει μια διάταξη με άλλη διάταξη, ενότητα, κεφάλαιο ή διαφορετικό πρότυπο.
Στο σημασιολογικό επίπεδο, οι παράγραφοι συνδέονται με καταστάσεις, αντικείμενα, ιδιότητες, τιμές, λειτουργίες και όρια. Πίνακες, σχήματα και εξισώσεις αποκτούν δικούς τους κόμβους και παραμένουν συνδεδεμένα με την παράγραφο προέλευσης. Η βάση περιλαμβάνει 2.375 κόμβους πινάκων, 1.224 κόμβους εξισώσεων και 53 κόμβους λειτουργιών.
Αυτή η διάκριση είναι κρίσιμη. Μια αριθμητική τιμή χωρίς μονάδα, συνθήκη και έκδοση μπορεί να είναι επικίνδυνα ελλιπής. Ο γράφος δεν αποθηκεύει μόνο «τι λέει το έγγραφο», αλλά και «πού ανήκει, σε τι αναφέρεται και από ποιο στοιχείο προκύπτει».
Ιχνηλασιμότητα δεν σημαίνει απλή εμφάνιση ενός link. Σημαίνει ότι η απάντηση μπορεί να επιστρέψει στη σωστή έκδοση, στη συγκεκριμένη διάταξη και στο στοιχείο που ορίζει τη συνθήκη ή την τιμή. Αν λείπει ένας από αυτούς τους κρίκους, η παραπομπή μπορεί να είναι αληθινή αλλά ανεπαρκής.
Γιατί η κατασκευή της γνώσης είναι υβριδική
Η ομάδα δεν αναθέτει όλη την εξαγωγή σε ένα LLM. Χρησιμοποιεί κανονικές εκφράσεις για τίτλους, αριθμούς προτύπων, έτη, αρίθμηση κεφαλαίων και παραπομπές. Πρόκειται για μοτίβα όπου οι ντετερμινιστικοί κανόνες προσφέρουν έλεγχο, επαναληψιμότητα και ευκολότερο debugging.
Το LLM αναλαμβάνει τη λεπτότερη σημασιολογική εργασία. Διασπά τις διατάξεις σε μικρότερες μονάδες και επισημαίνει τεχνικούς όρους, συγκρίσεις, συνθήκες, ιδιότητες και τιμές. Για εξισώσεις χρησιμοποιείται μαζί με το γειτονικό κείμενο, ώστε να περιγράψει σύμβολα και υπολογιστικές σχέσεις. Για πίνακες και σχήματα επιχειρεί να διατηρήσει κεφαλίδες, γραμμές, στήλες, σημειώσεις, διαστάσεις και γραφικά σύμβολα.
Ο καταμερισμός έχει πρακτική αξία πέρα από τα κτιριακά πρότυπα. Οι κανόνες χειρίζονται το προβλέψιμο σχήμα και το μοντέλο τη γλωσσική ποικιλία, ενώ κάθε έξοδος περνά από validator. Η ίδια αρχή βοηθά ένα εσωτερικό εργαλείο που μετατρέπεται από ιδέα σε εφαρμογή: το LLM επιταχύνει την ερμηνεία, αλλά τα κρίσιμα πεδία, οι ρόλοι και οι μεταβάσεις χρειάζονται ντετερμινιστικούς ελέγχους.
Ανάκτηση, παραπομπές και ελάχιστο πλήρες evidence
Η αποθήκευση γίνεται σε Neo4j μέσω Py2neo. Για παρόμοια αντικείμενα η εργασία χρησιμοποιεί τον συντελεστή Dice και δημιουργεί σχέση similarTo όταν η σταθμισμένη ομοιότητα ξεπερνά το 0,8. Το παράδειγμά της συνδέει τις διατυπώσεις «Grade HRB400 steel» και «HRB400 steel», επειδή αναφέρονται στην ίδια βασική έννοια.
Όταν έρχεται μια ερώτηση, το σύστημα εξάγει οντότητες, βρίσκει σχετικούς κόμβους και επεκτείνει το evidence μέσω ιεραρχίας και παραπομπών. Η εργασία αναφέρει ότι οι περισσότερες full-text αναζητήσεις και multi-hop διαδρομές στη συγκεκριμένη υλοποίηση επιστρέφουν σε λιγότερο από ένα δευτερόλεπτο. Αυτό είναι αποτέλεσμα της πειραματικής βάσης και των indexes της· δεν πρέπει να μεταφερθεί ως γενικό SLA.
Το ζητούμενο δεν είναι να δοθεί όλος ο γράφος στο μοντέλο. Είναι να επιλεγεί το ελάχιστο σύνολο που παραμένει πλήρες για τη συγκεκριμένη ερώτηση: κύρια διάταξη, εφαρμοζόμενη συνθήκη, σχετική εξαίρεση, ορισμός, πίνακας ή τύπος. Η αρχή συνδέεται άμεσα με τον σχεδιασμό καθοδήγησης ενός AI agent βάσει κατάστασης: το σωστό context εξαρτάται από το σημείο της εργασίας, όχι από το μέγιστο διαθέσιμο μήκος.
Πότε αξίζει ένα δομημένο knowledge layer: όταν η σωστή απάντηση εξαρτάται από εκδόσεις, αριθμητικά όρια, εξαιρέσεις, ιεραρχία, cross-references ή μη κειμενικά στοιχεία. Αν οι ερωτήσεις λύνονται αξιόπιστα από ένα μικρό, καθαρό και επίπεδο corpus, η πρόσθετη πολυπλοκότητα του γράφου πρέπει να δικαιολογηθεί με μετρήσιμο όφελος.
Τι μέτρησε το benchmark των 140 ερωτήσεων
Το benchmark περιλαμβάνει 140 ζεύγη ερώτησης-απάντησης, 20 σε καθεμία από επτά κατηγορίες: ορισμοί, αριθμητικές απαιτήσεις, μέθοδοι και κανόνες, προδιαγραφές υλικών, σενάρια εφαρμογής, κρίσεις σωστού-λάθους και ερωτήσεις που απαιτούν πίνακα ή εξίσωση. Η άμεση παραγωγή από κάθε μοντέλο συγκρίθηκε με την παραγωγή μέσω BEST-KAG υπό κοινές ρυθμίσεις.
Οι μετρικές ήταν BLEU-1, BLEU-2, ROUGE-L, cosine similarity και Expert Score. Δέκα ειδικοί βαθμολόγησαν αριθμητική ακρίβεια, πληρότητα, λογική συνοχή και ιχνηλασιμότητα. Οι συγγραφείς δίνουν μεγαλύτερο βάρος στην expert αξιολόγηση, επειδή η λεκτική ή σημασιολογική ομοιότητα δεν αποδεικνύει ότι μια απάντηση ακολουθεί τη σωστή διάταξη.
Αυτό είναι ώριμη επιλογή αξιολόγησης. Αν ένα σύστημα θα απαντά για πολιτικές επιστροφών, εγκρίσεις δαπανών ή τεχνικές οδηγίες, το test set πρέπει να περιλαμβάνει πραγματικές εξαιρέσεις και λάθη με επιχειρησιακό κόστος. Η γενική «ποιότητα απάντησης» δεν αρκεί, όπως δεν αρκεί και ένα ασαφές success rate όταν εξετάζεται ποιος ευθύνεται όταν αποτυγχάνει μια αυτοματοποίηση.
Τα ισχυρά αποτελέσματα και η εξαίρεση ChatGLM
Στη συνολική Expert Score, το Claude αυξήθηκε από 0,52 σε 0,83, το ChatGPT από 0,52 σε 0,82 και το Qwen από 0,48 σε 0,83. Οι σχετικές βελτιώσεις που αναφέρει η εργασία είναι 58,84%, 57,21% και 74,01% αντίστοιχα. Τα μεγαλύτερα οφέλη εμφανίστηκαν σε ερωτήσεις όπου η ορθότητα εξαρτάται από αριθμούς, διαδικασίες, υλικά, πίνακες και εξισώσεις.
Το ChatGLM παρουσίασε την αντίθετη συμπεριφορά: η Expert Score έπεσε από 0,3104 σε 0,0055. Οι συγγραφείς προτείνουν ως πιθανή εξήγηση την ευαισθησία στον θόρυβο μεγάλου context. Το αποτέλεσμα δεν αποδεικνύει γενική αδυναμία του μοντέλου· αποδεικνύει ότι το συγκεκριμένο pipeline και το συγκεκριμένο evidence format δεν ήταν συμβατά μαζί του.
Αυτό είναι ίσως το πιο χρήσιμο επιχειρηματικό εύρημα. Καλύτερη δομή γνώσης δεν εγγυάται καλύτερη τελική απάντηση. Χρειάζονται model-specific evidence budgets, reranking, prompt contract και regression tests. Αν ένα deployment αλλάξει retriever ή μοντέλο, το ασφαλές rollback πρέπει να επαναφέρει και τη σημασιολογική κατάσταση, όχι μόνο τον κώδικα ή τη βάση.
Οι Expert Scores είναι αποτέλεσμα του benchmark, όχι SLA παραγωγής. Το corpus, η γλώσσα, οι τύποι ερωτήσεων και οι ειδικοί ανήκουν στη μελέτη. Ένα εταιρικό σύστημα χρειάζεται δικό του gold set και ξεχωριστό όριο αποδοχής για κάθε κρίσιμη ροή.
Πώς μεταφράζεται σε επιχειρηματική βάση γνώσης
Η άμεση εφαρμογή του BEST-KAG αφορά την AEC βιομηχανία. Η αρχιτεκτονική αρχή, όμως, αφορά κάθε οργανισμό όπου η σωστή απάντηση εξαρτάται από σχέσεις και εξαιρέσεις: πολιτικές προϊόντων, όρους επιστροφών, playbooks εξυπηρέτησης, οδηγούς brand, τεχνικές προδιαγραφές, εγκρίσεις, συμβάσεις και διαδικασίες.
Σε ένα e-commerce περιβάλλον, για παράδειγμα, η απάντηση «δικαιούται επιστροφή» μπορεί να εξαρτάται από κατηγορία προϊόντος, χώρα, ημερομηνία, κατάσταση συσκευασίας, κανάλι αγοράς και ειδική εξαίρεση. Ένα επίπεδο chunk μπορεί να βρει τη γενική πολιτική αλλά να χάσει τον όρο εφαρμογής. Ένα σωστά σχεδιασμένο knowledge layer συνδέει την απόφαση με την έκδοση της πολιτικής και καταγράφει ποια δεδομένα χρησιμοποιήθηκαν.
Δεν προκύπτει από τη μελέτη ότι το BEST-KAG είναι έτοιμο προϊόν για e-commerce ή marketing. Προκύπτει ένα checklist σχεδιασμού: canonical πηγές, versioning, δομή, πολυτροπικά στοιχεία, provenance, evidence retrieval και domain-specific αξιολόγηση. Αυτά είναι τα ίδια θεμέλια που χρειάζονται οι αυτοματισμοί επιχειρήσεων με AI όταν περνούν από υποβοήθηση σε πραγματικές ενέργειες.
Έξι gates για ένα παραγωγικό pilot
Ένα χρήσιμο pilot ξεκινά από μία περιορισμένη απόφαση και όχι από την υπόσχεση «ρωτήστε οτιδήποτε». Η ομάδα πρέπει να γνωρίζει ποια έγγραφα είναι αυθεντικά, ποια ερώτηση επιτρέπεται να απαντήσει το σύστημα και πότε πρέπει να απέχει ή να ζητά ανθρώπινο έλεγχο.
Έξι συγκεκριμένα gates για ιχνηλάσιμη εταιρική γνώση
- Βήμα 1Ορίστε μία απόφαση και τον ιδιοκτήτη της
Περιγράψτε τον χρήστη, την ερώτηση, το αποδεκτό evidence και τον άνθρωπο που εγκρίνει αλλαγές στο corpus και στο όριο αυτοματοποίησης.
- Βήμα 2Κλειδώστε canonical πηγές και εκδόσεις
Καταγράψτε ποιο έγγραφο υπερισχύει, πότε τέθηκε σε ισχύ, ποιος το ενημερώνει και πώς αποσύρεται μια παλιά έκδοση χωρίς να χάνεται το audit trail.
- Βήμα 3Μοντελοποιήστε τις κρίσιμες σχέσεις
Διατηρήστε ιεραρχία, παραπομπές, εξαιρέσεις, τιμές, μονάδες, πίνακες και τύπους μόνο στον βαθμό που επηρεάζουν την απόφαση του pilot.
- Βήμα 4Συνδυάστε κανόνες, LLM και validators
Αναθέστε το προβλέψιμο parsing σε ντετερμινιστικούς κανόνες, τη σημασιολογική ποικιλία στο μοντέλο και τα κρίσιμα πεδία σε επαναλήψιμους ελέγχους.
- Βήμα 5Μετρήστε retrieval και απάντηση χωριστά
Ελέγξτε αν ανακτήθηκε η σωστή διάταξη, αν συμπεριλήφθηκε η εξαίρεση και αν η τελική απάντηση έμεινε πιστή. Ένα καλό τελικό κείμενο δεν διορθώνει λάθος evidence.
- Βήμα 6Δοκιμάστε κάθε μοντέλο και το rollback
Τρέξτε gold set ανά κατηγορία, μετρήστε abstention, latency και σοβαρότητα λάθους, και επαναφέρετε retriever, prompt, μοντέλο και schema ως ενιαία έκδοση όταν αποτύχει το gate.
Αν το pilot χρειάζεται μικρότερο μοντέλο ή τοπική εκτέλεση, τα ίδια tests παραμένουν απαραίτητα. Η δυνατότητα να τρέχει ένα σύστημα τοπικά, όπως στα μικρά μοντέλα τυπικής λογικής, αλλάζει το deployment και την ιδιωτικότητα· δεν καταργεί την ανάγκη για evidence contract.
Το ουσιαστικό μάθημα του BEST-KAG
Η αξιοπιστία δεν προστίθεται στο τέλος με την οδηγία «δώσε πηγές». Χτίζεται από τη μοντελοποίηση του εγγράφου, τη διατήρηση της προέλευσης, την ανάκτηση της σωστής αλυσίδας τεκμηρίων και την αξιολόγηση από ανθρώπους που γνωρίζουν το πεδίο. Το BEST-KAG δείχνει ότι αυτή η επένδυση μπορεί να βελτιώσει θεαματικά συμβατά μοντέλα σε απαιτητικές ερωτήσεις.
Ταυτόχρονα, η αποτυχία του ChatGLM υπενθυμίζει ότι περισσότερο context μπορεί να βλάψει. Η ώριμη στρατηγική δεν είναι «βάζουμε όλο το εγχειρίδιο στο prompt». Είναι «δίνουμε στο κατάλληλο μοντέλο το ελάχιστο πλήρες και ιχνηλάσιμο evidence για τη συγκεκριμένη ερώτηση, με σαφές όριο αποχής και ανθρώπινης έγκρισης».
Από διάσπαρτα έγγραφα σε ελεγχόμενη γνώση
Σχεδιάστε το knowledge layer και τα tests πριν συνδέσετε το AI με πραγματικές αποφάσεις
Η TWO DOTS χαρτογραφεί πηγές, εκδόσεις, κανόνες, retrieval, δικαιώματα και σημεία ανθρώπινης έγκρισης, ώστε ένα AI workflow να απαντά με ελέγξιμο evidence και να σταματά όταν η γνώση δεν επαρκεί.
Често задавани въпроси
Τι είναι το BEST-KAG;
Είναι ερευνητικό πλαίσιο Knowledge-Augmented Generation για ερωταπαντήσεις πάνω σε πρότυπα κτιριακής μηχανικής, με πολυτροπικό γράφο γνώσης και τεκμήρια σε επίπεδο διάταξης.
Πόσα πρότυπα περιλαμβάνει η βάση;
Η μελέτη αναφέρει 251 πρότυπα, 171.652 κόμβους και 310.914 ακμές. Τα μεγέθη περιγράφουν το συγκεκριμένο ερευνητικό corpus και όχι γενική απαίτηση για κάθε βάση γνώσης.
Πώς διαφέρει από ένα απλό RAG;
Δεν ανακτά μόνο σχετικά τμήματα κειμένου. Μοντελοποιεί ιεραρχία, παραπομπές, συνθήκες, όρια, πίνακες, σχήματα και εξισώσεις, ώστε η απάντηση να επιστρέφει στο συγκεκριμένο evidence.
Τι περιλάμβανε το benchmark;
Περιλάμβανε 140 ζεύγη ερώτησης-απάντησης σε επτά κατηγορίες. Η αξιολόγηση χρησιμοποίησε BLEU-1, BLEU-2, ROUGE-L, cosine similarity και Expert Score από δέκα ειδικούς.
Βελτιώθηκαν όλα τα μοντέλα;
Όχι. Claude, ChatGPT και Qwen βελτιώθηκαν στις συνολικές Expert Scores της μελέτης, ενώ το ChatGLM παρουσίασε μεγάλη πτώση με το συγκεκριμένο BEST-KAG pipeline.
Γιατί έχουν σημασία οι πίνακες και οι εξισώσεις;
Επειδή μια σωστή απάντηση μπορεί να εξαρτάται από συγκεκριμένο τύπο, παράμετρο, μονάδα και συνθήκη εφαρμογής που χάνονται όταν το έγγραφο αντιμετωπίζεται μόνο ως επίπεδο κείμενο.
Είναι έτοιμο για αυτόματο έλεγχο συμμόρφωσης;
Όχι ως γενική εγγύηση. Οι συγγραφείς το παρουσιάζουν ως ερευνητικό πλαίσιο και αναγνωρίζουν ότι η ενσωμάτωση σε πραγματικές ροές σχεδιασμού και συμμόρφωσης δεν έχει αξιολογηθεί συστηματικά.
Ποιο είναι το βασικό επιχειρηματικό συμπέρασμα;
Όταν μια απάντηση πρέπει να είναι αποδείξιμη, η ποιότητα των πηγών, οι εκδόσεις, οι σχέσεις γνώσης, η επιλογή evidence και τα model-specific tests είναι εξίσου κρίσιμα με την επιλογή LLM.