GuideSkill: όταν οι ιατρικές οδηγίες γίνονται εκτελέσιμες δεξιότητες για AI

Το GuideSkill μετατρέπει ιατρικές οδηγίες σε εκτελέσιμες δεξιότητες AI. Δείτε τα αποτελέσματα, τα όρια και το μάθημα για ασφαλείς αυτοματισμούς.

Τι θα άλλαζε αν ένα σύστημα τεχνητής νοημοσύνης δεν «διάβαζε» απλώς τις οδηγίες μιας επιχείρησης, αλλά μπορούσε να τις εκτελεί ως σαφείς, ελέγξιμους κανόνες; Αυτή είναι η ουσιαστική ιδέα πίσω από το GuideSkill, μια ερευνητική προσέγγιση για την κλινική συλλογιστική που μετατρέπει ιατρικές κατευθυντήριες οδηγίες σε εξωτερικές λειτουργίες. Το πεδίο εφαρμογής είναι η υγεία, όμως το αρχιτεκτονικό μάθημα αφορά κάθε οργανισμό που θέλει να χρησιμοποιήσει AI agents πάνω σε κρίσιμες διαδικασίες.

Η εργασία δεν ισχυρίζεται ότι το σύστημα είναι έτοιμο να πάρει κλινικές αποφάσεις στην πράξη. Οι ίδιοι οι ερευνητές το χαρακτηρίζουν ερευνητικό πρωτότυπο και ζητούν ευρύτερη κλινική επικύρωση. Εκείνο που τεκμηριώνει είναι ότι η εξειδικευμένη γνώση μπορεί να διαχωριστεί από το ίδιο το μοντέλο, να οργανωθεί σε επιθεωρήσιμες δεξιότητες και να συνδυαστεί με την ευελιξία ενός LLM.

Σύντομη απάντηση: το GuideSkill μετατρέπει κατευθυντήριες οδηγίες σε εξωτερικές Python functions που βαθμολογούν ρητά τα διαθέσιμα στοιχεία. Το LLM διατηρεί την ευελιξία να προτείνει υποψηφίους, ενώ οι εκτελέσιμοι κανόνες προσθέτουν επαναληψιμότητα, επιθεώρηση και ανεξάρτητο versioning χωρίς αλλαγή του βασικού μοντέλου.

Περιεχόμενα

Το πρόβλημα δεν είναι η πρόσβαση στη γνώση, αλλά η σωστή εκτέλεσή της

Τα μεγάλα γλωσσικά μοντέλα μπορούν να ανακτούν κείμενο, να συνοψίζουν οδηγίες και να προτείνουν πιθανές απαντήσεις. Αυτό όμως δεν εγγυάται ότι θα εφαρμόσουν με ακρίβεια τα κριτήρια, τα κατώφλια, τις εξαιρέσεις και τις λογικές σχέσεις που περιλαμβάνει μια επίσημη διαδικασία. Στην κλινική διάγνωση, η διαφορά είναι κρίσιμη: άλλο να εμφανιστεί μια οδηγία μέσα στο context και άλλο να αξιολογηθούν συστηματικά τα στοιχεία που υποστηρίζουν ή αποδυναμώνουν κάθε πιθανή διάγνωση.

Το GuideSkill αντιμετωπίζει τις οδηγίες ως λειτουργική γνώση. Αντί να ζητά από το LLM να ερμηνεύσει κάθε φορά ένα μεγάλο κείμενο, δημιουργεί για κάθε κατηγορία νόσου μια εκτελέσιμη Python function. Η λειτουργία λαμβάνει τα σχετικά χαρακτηριστικά μιας περίπτωσης και επιστρέφει ένα από τέσσερα επίπεδα υποστήριξης: επιβεβαιωμένη, ισχυρά ενδεικτική, συμβατή ή μη υποστηριζόμενη διάγνωση. Αν υπάρχουν αντικρουόμενα στοιχεία, αυτά μπορούν να μειώσουν το επίπεδο υποστήριξης.

Πώς χτίζεται η αρχική βιβλιοθήκη GuideSkill-Zero

Η αρχική έκδοση της βιβλιοθήκης ξεκινά από κλινικές κατευθυντήριες οδηγίες. Η διαδικασία φιλτράρει το υλικό, εξάγει συστάσεις που καταλήγουν σε συμπέρασμα επιπέδου νόσου και τις αντιστοιχίζει σε κατηγορίες τριών χαρακτήρων του ICD-10. Δηλώσεις που αφορούν, για παράδειγμα, μόνο την καταλληλότητα μιας εξέτασης και όχι διαγνωστικό συμπέρασμα εξαιρούνται.

Σύμφωνα με την εργασία, 37.970 ετερογενή έγγραφα περιορίστηκαν σε 3.938 επιμελημένες οδηγίες. Από αυτές προέκυψαν 1.200 διαγνωστικές συστάσεις για 349 μοναδικές κατηγορίες ICD-10. Οι συστάσεις για την ίδια νόσο συγχωνεύθηκαν, απο-διπλοποιήθηκαν και μετατράπηκαν σε 349 εκτελέσιμες δεξιότητες. Αυτή η βιβλιοθήκη ονομάζεται GuideSkill-Zero, επειδή έχει δημιουργηθεί από τις οδηγίες πριν χρησιμοποιηθούν ζεύγη πραγματικών περιστατικών και διαγνώσεων για εξέλιξη.

Η εξέλιξη με περιστατικά καλύπτει όσα λείπουν από τις οδηγίες

Οι κατευθυντήριες οδηγίες δεν καλύπτουν κάθε σπάνια ή σύνθετη παρουσίαση. Για αυτό η δεύτερη φάση, GuideSkill-Evo, χρησιμοποιεί επισημασμένα ζεύγη περιστατικού και σωστής διάγνωσης. Το LLM δημιουργεί μια αιτιολόγηση από τα κλινικά στοιχεία και οι αιτιολογήσεις για την ίδια διάγνωση συγκεντρώνονται σε πρόσθετους κανόνες.

Αν υπάρχει ήδη δεξιότητα για τη συγκεκριμένη κατηγορία, οι νέοι κανόνες χρησιμοποιούνται για τη βελτίωσή της. Αν δεν υπάρχει, δημιουργείται νέα δεξιότητα. Η βιβλιοθήκη επεκτάθηκε από 349 σε 473 κατηγορίες ICD-10. Η κάλυψη της σωστής ετικέτας στα test cases αυξήθηκε από 56,5% σε 99,5%, δηλαδή κατά 43 ποσοστιαίες μονάδες.

Αυτό το αποτέλεσμα έχει ιδιαίτερη σημασία για επιχειρησιακά AI συστήματα. Μια εξωτερική βιβλιοθήκη διαδικασιών μπορεί να ενημερώνεται χωρίς επανεκπαίδευση του βασικού μοντέλου. Η ερμηνεία για τις επιχειρήσεις είναι ότι η γνώση δεν χρειάζεται να «κλειδώνει» μέσα στα βάρη ενός μοντέλου: μπορεί να διατηρείται ως ελεγχόμενο λειτουργικό επίπεδο με έκδοση, προέλευση και δυνατότητα αναθεώρησης. Ο ίδιος διαχωρισμός βοηθά να οριστεί τι αναλαμβάνει ο άνθρωπος και τι ο AI συνεργάτης σε μια πραγματική επιχειρησιακή ροή.

Η τελική απόφαση συνδυάζει το LLM με τους εκτελέσιμους κανόνες

Κατά την εκτέλεση, το LLM προτείνει αρχικά μια ταξινομημένη διαφορική διάγνωση. Το προεπιλεγμένο πλήθος υποψηφίων είναι πέντε. Για κάθε υποψήφια διάγνωση, ανακτάται η αντίστοιχη δεξιότητα και το LLM εξάγει από το περιστατικό μόνο τα χαρακτηριστικά που χρειάζεται η συγκεκριμένη λειτουργία. Η δεξιότητα εκτελείται και επιστρέφει βαθμολογία υποστήριξης.

Η κατάταξη του LLM και η βαθμολογία της δεξιότητας συνδυάζονται. Η βασική ρύθμιση δίνει ίσο βάρος στα δύο σήματα, με συντελεστή 0,5. Έτσι το LLM διατηρεί τον ρόλο του στην ανοιχτή παραγωγή υποψηφίων, ενώ ο εκτελέσιμος κανόνας επανελέγχει κάθε υποψήφιο με ειδικά κριτήρια. Η προσέγγιση δεν υποκαθιστά τη γενική ικανότητα του μοντέλου· προσθέτει ένα δεύτερο, πιο επαναλήψιμο επίπεδο ελέγχου.

Τι έδειξαν τα τέσσερα benchmarks και τα τέσσερα μοντέλα

Η αξιολόγηση περιέλαβε τα MedCaseReasoning, ER-Reason, MIMIC-CDM-FI και MedThink-Bench. Τα test sets είχαν συνολικά 1.403 περιστατικά και 448 κατηγορίες ICD-10. Χρησιμοποιήθηκαν GPT-5.4, Claude-Sonnet-4.6, MedGemma-27B και Qwen3.5-9B, ώστε να καλυφθούν ιδιόκτητα και open-weight μοντέλα, γενικής χρήσης και ιατρικά εξειδικευμένα.

Το GuideSkill-Zero ξεπέρασε το guideline RAG στη macro-average ακρίβεια για κάθε backbone, με μέση βελτίωση 13,45% όπως αναφέρει το abstract. Μετά την εξέλιξη, το GuideSkill-Evo πέτυχε την υψηλότερη macro-average ακρίβεια για όλα τα backbones: 56,97 με GPT-5.4, 56,64 με Claude-Sonnet-4.6, 49,84 με MedGemma-27B και 50,98 με Qwen3.5-9B.

Στις 16 συγκρίσεις dataset–backbone απέναντι στο direct inference, το GuideSkill-Evo ήταν καλύτερο σε όλες. Το MedThink-Bench είχε εξαιρεθεί από τα δεδομένα εξέλιξης, αλλά το σύστημα ξεπέρασε το GuideSkill-Zero και με τα τέσσερα backbones σε αυτό το benchmark. Αυτό υποστηρίζει την προσεκτική ερμηνεία ότι μέρος των case-derived updates μεταφέρθηκε σε ένα μη χρησιμοποιημένο benchmark· δεν αποδεικνύει γενική κλινική ασφάλεια.

Τέσσερα τεκμηριωμένα μεγέθη του GuideSkill

Οι τιμές προέρχονται από τα συγκεκριμένα πειράματα της εργασίας. Η κάλυψη αφορά το αν υπάρχει skill για τη σωστή ICD-10 κατηγορία και δεν ισοδυναμεί με κλινική ακρίβεια ή ασφάλεια.

349 → 473κατηγορίες δεξιοτήτων

Η εξέλιξη με επισημασμένα περιστατικά πρόσθεσε ή κάλυψε διαγνώσεις πέρα από την αρχική βιβλιοθήκη οδηγιών.

56,5% → 99,5%κάλυψη σωστής ετικέτας

Η pooled κάλυψη των test cases αυξήθηκε κατά 43 ποσοστιαίες μονάδες.

+13,45%σχετική βελτίωση έναντι guideline RAG

Ο μέσος macro-average δείκτης του GuideSkill-Zero ήταν υψηλότερος για κάθε backbone.

+18,49%σχετική βελτίωση έναντι direct inference

Το GuideSkill-Evo βελτίωσε και τις 16 συγκρίσεις dataset–backbone της μελέτης.

Γιατί το RAG δεν αρκεί όταν η διαδικασία έχει αυστηρή λογική

Το RAG προσθέτει σχετικά αποσπάσματα στο prompt και αφήνει το μοντέλο να τα ερμηνεύσει. Είναι χρήσιμο όταν χρειάζεται πρόσβαση σε πηγές, αλλά η ανάκτηση από μόνη της δεν κάνει τη λογική ντετερμινιστική. Το GuideSkill διαφοροποιείται επειδή το κριτήριο εκτελείται ως function και επιστρέφει συγκεκριμένο επίπεδο υποστήριξης.

Η σύγκριση εκτελέσιμων και κειμενικών skills έδειξε παρόμοια μέση ακρίβεια, 60,94 έναντι 60,60, με ίδια candidate sets και fusion parameters. Η εκτελέσιμη εκδοχή όμως δεν παρουσίασε μεταβολή ανάμεσα σε πέντε επαναλήψεις, ενώ η κειμενική παρουσίασε μικρή διακύμανση. Το ουσιαστικό πλεονέκτημα επομένως δεν είναι μόνο μια καλύτερη μέση τιμή, αλλά ένα πιο επαναλήψιμο interface αξιολόγησης μετά την εξαγωγή χαρακτηριστικών.

Τέσσερα επίπεδα γνώσης και ελέγχου για έναν AI agent

Guideline RAG

Ανακτά το σχετικό κείμενο, αλλά αφήνει στο LLM την ερμηνεία των κατωφλίων, εξαιρέσεων και συνδυαστικών κριτηρίων σε κάθε εκτέλεση.

ΠρόσβασηΚείμενο

Textual skill

Συμπυκνώνει τον κανόνα σε σαφή rubric, όμως η τελική βαθμολόγηση εξακολουθεί να παράγεται από το μοντέλο και μπορεί να μεταβάλλεται.

RubricLLM scoring

Executable skill

Μεταφέρει τα κριτήρια σε function που επιστρέφει προκαθορισμένο tier μετά την εξαγωγή των απαιτούμενων χαρακτηριστικών.

FunctionRepeatable

Human approval

Παραμένει απαραίτητο για αλλαγές κανόνων, αμφίβολα inputs και αποφάσεις με υψηλό κίνδυνο· ο εκτελέσιμος κανόνας δεν νομιμοποιεί αυτόνομη τελική πράξη.

ΈγκρισηΛογοδοσία

Το κρίσιμο bottleneck παραμένει πριν από την εκτέλεση

Καμία δεξιότητα δεν μπορεί να διορθώσει μια διάγνωση που δεν μπήκε ποτέ στη λίστα υποψηφίων. Στην ανάλυση λαθών με Claude-Sonnet-4.6, από τα 749 σφάλματα τα 456, δηλαδή 60,9%, συνέβησαν επειδή η σωστή κατηγορία ICD-10 έλειπε από το candidate set. Η ανάκληση των υποψηφίων ήταν επομένως ο κυρίαρχος εναπομείνας μηχανισμός αποτυχίας.

Αυτό είναι σημαντικό για κάθε agentic workflow. Ένας downstream validator λειτουργεί μόνο πάνω στις επιλογές που λαμβάνει. Αν το προηγούμενο στάδιο παραλείψει τη σωστή επιλογή, ένας άριστος κανόνας αξιολόγησης δεν αρκεί. Η αρχιτεκτονική χρειάζεται λοιπόν παρακολούθηση τόσο της ποιότητας των κανόνων όσο και της κάλυψης στο στάδιο παραγωγής υποψηφίων. Πρόκειται για το ίδιο πρόβλημα απόδοσης ευθύνης που συναντάμε όταν πρέπει να φανεί ποια αναζήτηση ή ενέργεια ενός AI agent βοήθησε πραγματικά.

Η ανθρώπινη αξιολόγηση είναι θετική, αλλά περιορισμένη

Ένας κλινικός αξιολόγησε δέκα δεξιότητες: πέντε βασισμένες σε οδηγίες και πέντε προερχόμενες από περιστατικά. Η αξιολόγηση κάλυψε 42 αρχικούς κανόνες, 100 περιστατικά εξέλιξης, 120 τελικούς κανόνες και 51 held-out cases. Το 95,2% των αρχικών κανόνων κρίθηκε συνεπές με τις οδηγίες, ενώ και οι πέντε guideline-initialized δεξιότητες δεν είχαν σημαντικό κλινικό σφάλμα.

Στα held-out περιστατικά, όλες οι σωστές διαγνώσεις έλαβαν επίπεδο υποστήριξης τουλάχιστον 2 και το 86,3% των outputs βρέθηκε σε απόσταση το πολύ ενός tier από την κρίση του κλινικού. Η συνολική quadratic-weighted kappa ήταν 0,60, επίπεδο που οι συγγραφείς περιγράφουν ως μέτρια συμφωνία. Εννέα από τις δέκα τελικές δεξιότητες έγιναν δεκτές χωρίς αλλαγές ή με μικρές διορθώσεις.

Η μία περίπτωση που απαίτησε σημαντική αναθεώρηση είναι εξίσου διδακτική με τα θετικά αποτελέσματα: ένα evolution case οδήγησε σε υπεργενίκευση ενός ειδικού μοτίβου και αλλοίωσε έναν αρχικά σωστό κανόνα. Άρα η εξέλιξη από παραδείγματα δεν είναι αυτομάτως ασφαλής. Χρειάζεται provenance, review των διαφορών και έλεγχος για case-specific patterns.

Κόστος, αποδοτικότητα και η πιο ελαφριά παραλλαγή

Η πλήρης εκτέλεση του GuideSkill δεν είναι δωρεάν. Στην ανάλυση για το MedCaseReasoning με GPT-5.4, η βασική εκδοχή είχε υψηλότερο εκτιμώμενο κόστος από τις prompting baselines. Η αποδοτικότερη παραλλαγή GuideSkill-Effi χρησιμοποιεί batched feature grounding. Σύμφωνα με την εργασία, μείωσε το εκτιμώμενο API cost κατά 72,7%, με πτώση μόλις 0,34 ποσοστιαίας μονάδας στην ακρίβεια του συγκεκριμένου benchmark.

Για μια επιχείρηση, αυτό δείχνει ότι ο σχεδιασμός των tool calls και της εξαγωγής features μπορεί να είναι εξίσου σημαντικός με την επιλογή μοντέλου. Η μετατροπή κάθε κανόνα σε ξεχωριστό prompt μπορεί να δημιουργήσει μεγάλο latency και κόστος. Η ομαδοποίηση, η cache των σταθερών κανόνων και η εκτέλεση μόνο των σχετικών δεξιοτήτων είναι θέματα αρχιτεκτονικής που πρέπει να μετρηθούν σε πραγματικό workload.

Τι μπορούν να κρατήσουν e-commerce και marketing ομάδες

Το GuideSkill αφορά κλινική διάγνωση, άρα δεν πρέπει να μεταφερθούν αυτούσια τα ιατρικά αποτελέσματα σε marketing. Η ασφαλής επιχειρησιακή ερμηνεία είναι αρχιτεκτονική. Ένας AI agent μπορεί να παράγει δημιουργικά υποψήφιες ενέργειες, ενώ εξωτερικές δεξιότητες εφαρμόζουν ρητούς κανόνες για όρια έκπτωσης, brand voice, consent, eligibility, επιστροφές ή escalation. Αυτό είναι ανάλυση της σχεδιαστικής αρχής και όχι εύρημα της μελέτης για τέτοιους κλάδους.

Σε ένα e-commerce workflow, για παράδειγμα, το LLM θα μπορούσε να προτείνει πιθανή απάντηση σε αίτημα πελάτη και μια εκτελέσιμη policy function να ελέγχει αν πληρούνται οι πραγματικοί όροι επιστροφής. Σε content operations, το μοντέλο θα μπορούσε να προτείνει claims, ενώ ένας rule layer να απορρίπτει όσα δεν έχουν τεκμηριωμένη πηγή ή παραβιάζουν εγκεκριμένες διατυπώσεις. Η αξία βρίσκεται στον διαχωρισμό δημιουργικής πρότασης και ντετερμινιστικού ελέγχου, με ελάχιστα και δυναμικά δικαιώματα για κάθε AI agent.

Η υλοποίηση χρειάζεται τουλάχιστον μητρώο δεξιοτήτων, αντιστοίχιση κάθε skill με ιδιοκτήτη και πηγή, versioning, tests, logs για τα inputs και outputs, καθώς και διαδικασία έγκρισης αλλαγών. Οι case-derived updates δεν πρέπει να περνούν απευθείας στην παραγωγή. Το ίδιο το paper δείχνει γιατί: ένα μεμονωμένο περιστατικό μπορεί να παράγει κανόνα που γενικεύει λάθος. Το audit trail πρέπει επίσης να ξεκαθαρίζει ποιος αναλαμβάνει όταν μια αυτοματοποίηση αποτυγχάνει.

Έξι βήματα για μια επιχειρησιακή βιβλιοθήκη εκτελέσιμων κανόνων

  1. Βήμα 1Ορίστε την απόφαση και το όριο αυτονομίας

    Καταγράψτε ποιο output προτείνει το LLM, ποια πράξη επιτρέπεται να εκτελεστεί και πότε απαιτείται ανθρώπινη έγκριση ή ασφαλής διακοπή.

  2. Βήμα 2Μετατρέψτε μόνο σαφείς πολιτικές σε rules

    Ξεκινήστε από κριτήρια με συγκεκριμένα inputs, κατώφλια, εξαιρέσεις και ιδιοκτήτη· μην κωδικοποιείτε αμφίσημη πολιτική ως βέβαιη αλήθεια.

  3. Βήμα 3Διατηρήστε provenance και έκδοση

    Κάθε function πρέπει να δείχνει στην εγκεκριμένη πηγή, στην ημερομηνία ισχύος, στον υπεύθυνο και στο ιστορικό αλλαγών της.

  4. Βήμα 4Δοκιμάστε θετικά, αρνητικά και οριακά cases

    Ελέγξτε όχι μόνο πότε ενεργοποιείται ο κανόνας, αλλά και πότε πρέπει να απορρίπτει, να υποβαθμίζει ή να ζητά πρόσθετα στοιχεία.

  5. Βήμα 5Μετρήστε και την κάλυψη υποψηφίων

    Παρακολουθήστε αν το σωστό προϊόν, αίτημα, intent ή policy μπήκε καν στη λίστα που θα αξιολογήσει ο downstream validator.

  6. Βήμα 6Εγκρίνετε κάθε αλλαγή πριν από production

    Συγκρίνετε το diff, τρέξτε regression tests, κρατήστε audit log και προβλέψτε rollback όταν ένα νέο case υπεργενικεύει τον κανόνα.

Αυτό ευθυγραμμίζεται με το NIST AI RMF, το οποίο ζητά σαφείς ρόλους και ευθύνες για human-AI oversight, και με τις οδηγίες του OWASP για καταγραφή tool calls, αποτελεσμάτων, εγκρίσεων και της έκδοσης πολιτικής σε ενέργειες υψηλού κινδύνου.

Τα όρια που δεν πρέπει να χαθούν πίσω από τα ποσοστά

Η βιβλιοθήκη δημιουργήθηκε από περιορισμένο σύνολο οδηγιών και πολλές ποιοτικές πηγές δεν έχουν ακόμη ενσωματωθεί. Η αρχικοποίηση και η εξέλιξη έγιναν αυτοματοποιημένα με LLM, κάτι που διευκολύνει την κλιμάκωση αλλά αυξάνει την ανάγκη ανθρώπινης επαλήθευσης. Επιπλέον, η κλινική αξιολόγηση έγινε από έναν κλινικό και σε δέκα δεξιότητες, άρα δεν αρκεί για ευρεία επιβεβαίωση.

Η αξιολόγηση βασίστηκε σε τριψήφιες κατηγορίες ICD-10 και η σημασιολογική αντιστοίχιση περιλάμβανε LLM-as-a-judge, το οποίο οι συγγραφείς αναγνωρίζουν ως πιθανή πηγή bias και περιορισμών συλλογιστικής. Κυρίως, το GuideSkill παραμένει ερευνητικό πρωτότυπο και δεν προορίζεται για άμεση χρήση σε πραγματικές κλινικές συνθήκες.

Από το «δώσε στο AI το εγχειρίδιο» στο «κάνε τη διαδικασία ελέγξιμη»

Η πιο χρήσιμη ιδέα της εργασίας είναι ότι η οργανωσιακή γνώση δεν χρειάζεται να υπάρχει μόνο ως κείμενο σε μια βάση RAG ή ως αόρατη συμπεριφορά μέσα σε fine-tuned weights. Μπορεί να εκφραστεί ως εξωτερικό σύνολο δεξιοτήτων που εκτελούνται, δοκιμάζονται, αναθεωρούνται και επαναχρησιμοποιούνται από διαφορετικά μοντέλα.

Αυτό δεν εξαλείφει τα λάθη. Μετακινεί όμως ένα μέρος της κρίσιμης λογικής σε χώρο όπου μπορεί να επιθεωρηθεί. Για επιχειρήσεις που σχεδιάζουν AI agents, η σωστή ερώτηση δεν είναι μόνο «ποιο μοντέλο απαντά καλύτερα;». Είναι επίσης «ποιο μέρος της απόφασης πρέπει να παραμένει δημιουργικό και ποιο πρέπει να γίνει ρητός, ελέγξιμος και versioned κανόνας;»

Το κριτήριο πριν από την παραγωγή

Μην κάνετε μια πολιτική εκτελέσιμη πριν γίνει σαφής, ελέγξιμη και αναστρέψιμη.

Η σωστή αρχιτεκτονική χωρίζει την πρόταση του LLM, την εκτέλεση του κανόνα και την έγκριση της πράξης, ενώ μετρά τόσο την ακρίβεια όσο και την κάλυψη των υποψηφίων που φτάνουν στον έλεγχο.

Αυτοματισμοί επιχειρήσεων και AI από την TWO DOTS

Μετατρέψτε τις εταιρικές πολιτικές σε ελέγξιμα AI workflows.

Η TWO DOTS σχεδιάζει αυτοματισμούς όπου το LLM προτείνει, οι εκτελέσιμοι κανόνες ελέγχουν και οι άνθρωποι εγκρίνουν τις ενέργειες που επηρεάζουν πελάτες, παραγγελίες, περιεχόμενο ή δεδομένα.

Συχνές ερωτήσεις

Τι είναι το GuideSkill;

Είναι ερευνητικό framework που μετατρέπει κλινικές οδηγίες σε εξωτερικές εκτελέσιμες δεξιότητες και συνδυάζει τις βαθμολογίες τους με την κατάταξη διαγνώσεων ενός LLM.

Ποια είναι η διαφορά από το guideline RAG;

Το RAG προσθέτει σχετικό κείμενο στο context. Το GuideSkill εκτελεί disease-specific functions που εφαρμόζουν ρητούς κανόνες και επιστρέφουν επίπεδο διαγνωστικής υποστήριξης.

Χρειάζεται fine-tuning του βασικού μοντέλου;

Όχι για τον μηχανισμό GuideSkill. Οι δεξιότητες βρίσκονται εκτός του backbone και μπορούν να αναθεωρούνται ή να επεκτείνονται χωρίς αλλαγή των παραμέτρων του.

Πόσο αυξήθηκε η κάλυψη των σωστών κατηγοριών;

Στα test cases της εργασίας, η κάλυψη της σωστής ICD-10 κατηγορίας από τη βιβλιοθήκη αυξήθηκε από 56,5% στο GuideSkill-Zero σε 99,5% στο GuideSkill-Evo, δηλαδή κατά 43 ποσοστιαίες μονάδες.

Ποια είναι η βασική αποτυχία που παραμένει;

Η σωστή διάγνωση μπορεί να λείπει από την αρχική λίστα υποψηφίων. Αυτό εξηγούσε 456 από τα 749 λάθη στην αναφερόμενη ανάλυση με Claude-Sonnet-4.6.

Τι σημαίνει ότι μια δεξιότητα είναι εκτελέσιμη;

Σημαίνει ότι τα κριτήρια έχουν μετατραπεί σε function με ορισμένα inputs και προκαθορισμένη λογική βαθμολόγησης, αντί να ερμηνεύονται από το LLM ως ελεύθερο κείμενο σε κάθε run.

Είναι το GuideSkill έτοιμο για χρήση σε ασθενείς;

Όχι. Οι συγγραφείς το χαρακτηρίζουν ερευνητικό πρωτότυπο, δεν το προορίζουν για άμεση κλινική ανάπτυξη και ζητούν ευρύτερη επικύρωση.

Ποιο είναι το πρακτικό μάθημα για επιχειρησιακά AI workflows;

Διαχωρίστε τη δημιουργική πρόταση του LLM από τους κανόνες που εγκρίνουν, απορρίπτουν ή κλιμακώνουν μια ενέργεια. Κρατήστε τους κανόνες versioned, δοκιμασμένους, επιθεωρήσιμους και υπό ανθρώπινη εποπτεία.

Ενημερωτικό Δελτίο

Εισάγετε τη διεύθυνση email σας παρακάτω για να εγγραφείτε στο ενημερωτικό δελτίο μας