With over 20 years of experience, we transform your digital presence. We specialize in website and E-Shop development, SEO and Digital Marketing, ERP software and smart automation that take your business to the next level.
Το BioCheck Agent δείχνει ότι κάθε κρίσιμο claim χρειάζεται πηγή, evidence span και ανθρώπινο έλεγχο.
Answer first: το BioCheck Agent δεν αντιμετωπίζει το biomedical fact-checking ως ένα απλό «σωστό ή λάθος». Αναζητά στο PubMed, χωρίζει τα υποστηρικτικά από τα αντικρουόμενα τεκμήρια και εκπαιδεύεται να τιμωρεί κατασκευασμένα PMIDs ή αποσπάσματα που δεν αντιστοιχούν στην πηγή. Η αξία του paper για μια επιχείρηση βρίσκεται κυρίως σε αυτό το ελέγξιμο μονοπάτι, όχι σε μια αυτόματη ιατρική ετυμηγορία.
Το BioCheck Agent αναζητά στο PubMed και συνθέτει ελέγξιμη αναφορά. Τι έδειξε το EG-GRPO για ακρίβεια, evidence quality και hallucinations στην πράξη.
Μπορεί ένα AI να ελέγξει έναν ισχυρισμό υγείας χωρίς να μετατρέψει μια πρόχειρη απάντηση σε επικίνδυνη βεβαιότητα; Το κρίσιμο σημείο δεν είναι μόνο αν θα επιλέξει τη σωστή ετικέτα. Είναι αν μπορεί να δείξει ποια επιστημονική βιβλιογραφία βρήκε, πώς τη συνέδεσε με τον ισχυρισμό, ποια στοιχεία συγκρούονται και γιατί κατέληξε στο συμπέρασμα.
Αυτό επιχειρεί το BioCheck Agent, ένα ερευνητικό σύστημα των Jiongxiao Wang, Dingli Ma και Chaoqun Ni. Η προδημοσίευση προτείνει έναν agent που αναζητά αποκλειστικά στο PubMed και παράγει δομημένες αναφορές βιοϊατρικού fact-checking. Παράλληλα εισάγει το Evidence-Grounded Group Relative Policy Optimization (EG-GRPO), μια μέθοδο reinforcement learning που δεν ανταμείβει μόνο τη σωστή τελική ετικέτα, αλλά και τη συμπεριφορά αναζήτησης, την ποιότητα των τεκμηρίων και την αποφυγή κατασκευασμένων παραπομπών.
Για publishers, health brands, ομάδες περιεχομένου και όσους σχεδιάζουν AI agents για παραγωγικά workflows, το σημαντικό μάθημα είναι λειτουργικό: η αξιοπιστία δεν προκύπτει από πιο πειστική πρόζα, αλλά από μια αλυσίδα ενεργειών που μπορεί να ελεγχθεί.
Ο αυτοματοποιημένος έλεγχος γεγονότων ξεκίνησε σε μεγάλο βαθμό ως πρόβλημα ταξινόμησης. Ένα σύστημα έπρεπε να αποδώσει μια ετικέτα: υποστηρίζεται, διαψεύδεται ή δεν υπάρχουν αρκετές πληροφορίες. Στη βιοϊατρική, όμως, η ετικέτα δεν εξηγεί την ισχύ της διαθέσιμης γνώσης, τον πληθυσμό μιας μελέτης, τις συνθήκες της παρέμβασης ή το εύρος της αβεβαιότητας.
Οι λανθασμένοι ισχυρισμοί υγείας μπορούν να επηρεάσουν αποφάσεις για θεραπεία, εμβολιασμό, συμμόρφωση με οδηγίες και εμπιστοσύνη στους θεσμούς. Γι’ αυτό η εξήγηση δεν είναι διακοσμητικό στοιχείο. Είναι μέρος της ίδιας της χρησιμότητας ενός fact-check.
Η κατεύθυνση του BioCheck Agent είναι η μετάβαση από το retrieve-then-verify at retrieve, analyze and report. Το σύστημα δεν καλείται απλώς να βρει κάτι σχετικό. Πρέπει να παρουσιάσει όσα στοιχεία συμφωνούν, όσα διαφωνούν, μια σύνθεση και ένα αιτιολογημένο συμπέρασμα.
Η αρχιτεκτονική και η αναζήτηση στο PubMed
Ο agent υλοποιείται με LangGraph. Οι κόμβοι αντιστοιχούν σε ενέργειες και οι ακμές καθορίζουν τη ροή. Το μοντέλο ξεκινά σε κόμβο LLM, αποφασίζει αν χρειάζεται εργαλείο αναζήτησης και, όταν υπάρχει tool call, μεταφέρεται στον κόμβο του PubMed. Μετά το αποτέλεσμα επιστρέφει στο μοντέλο για νέα κρίση: θα αναζητήσει ξανά ή έχει αρκετά στοιχεία για report;
Το εργαλείο pubmed_search χρησιμοποιεί το API του PubMed. Για κάθε αναζήτηση επιστρέφει έως πέντε papers και τροφοδοτεί τον agent με τίτλους και abstracts, επειδή το πλήρες κείμενο δεν είναι σταθερά διαθέσιμο και το context είναι περιορισμένο. Το πείραμα επιτρέπει έως πέντε επαναληπτικές αναζητήσεις.
Υπάρχει επίσης μηχανισμός παρέμβασης. Αν εξαντληθεί το search budget, προστίθεται οδηγία που αναγκάζει το μοντέλο να σταματήσει και να γράψει την αναφορά με όσα στοιχεία έχουν ήδη συλλεχθεί. Είναι το ίδιο είδος ορίου που χρειάζεται ένα εταιρικό RAG σύστημα: σαφές corpus, οροφή κόστους και προβλέψιμος τερματισμός.
Από τις λέξεις-κλειδιά σε ακαδημαϊκή αναζήτηση
Το BioCheck Agent δεν ανταμείβεται απλώς επειδή κάλεσε μια μηχανή αναζήτησης. Ενθαρρύνεται να αποσυνθέτει τον ισχυρισμό σε βασικές οντότητες και να κατασκευάζει queries με Boolean τελεστές AND and OR. Η λογική θυμίζει προσεκτική βιβλιογραφική αναζήτηση και όχι γενική web αναζήτηση.
Το Advanced Search Reward ορίζεται ως ο λόγος των queries που περιέχουν Boolean operator προς το σύνολο των searches. Δεν αποδεικνύει από μόνο του ότι ένα query είναι καλό. Κάνει όμως μετρήσιμη μια επιθυμητή συμπεριφορά: το μοντέλο να διατυπώνει πιο συγκεκριμένες σχέσεις μεταξύ εννοιών.
Για μια επιχείρηση, το ευρύτερο μάθημα είναι ότι η ποιότητα του agent εξαρτάται και από τον χώρο αναζήτησης. Το paper περιορίζει τις πηγές στο PubMed για να αυξήσει τη συνάφεια και την επιστημονική αυθεντία. Αυτό δεν σημαίνει ότι κάθε abstract είναι οριστική αλήθεια. Σημαίνει ότι το σύστημα ξεκινά από ορισμένο corpus αντί να αναμιγνύει ανεξέλεγκτα blogs, promotional pages και επιστημονικά άρθρα.
Η αναφορά έχει τέσσερα διακριτά μέρη
Το παραγόμενο report οργανώνεται σε Supporting Evidence, Refuting Evidence, Summary and Conclusion. Κάθε τεκμήριο περιλαμβάνει PMID, μια κορυφαία πρόταση από το abstract και σχετικό context. Η σύνοψη συγκρίνει τις δύο πλευρές, κάνει consensus check και αιτιολογεί την απόφαση. Στο τέλος επιστρέφεται η ετικέτα SUPPORTED ή REFUTED.
Η χωριστή παρουσίαση υποστηρικτικών και αντικρουόμενων στοιχείων μειώνει τον κίνδυνο να αναζητούνται μόνο όσα επιβεβαιώνουν την πρώτη υπόθεση. Το reward επιτρέπει να διατηρούνται στοιχεία που αντιτίθενται στην τελική απόφαση και τα λαμβάνει υπόψη στον υπολογισμό ποιότητας.
Για editorial ομάδες, αυτή η μορφή είναι πιο χρήσιμη από μια ενιαία παράγραφο. Επιτρέπει στον reviewer να εντοπίσει γρήγορα την πηγή, να ελέγξει αν το απόσπασμα υπάρχει και να διακρίνει το evidence από την ερμηνεία. Όπως και σε ένα AI audit trail για οικονομικές αποφάσεις, η δομή δεν καταργεί τον άνθρωπο· του δίνει καλύτερο ίχνος ελέγχου.
Τι ακριβώς επιβραβεύει το EG-GRPO
Το EG-GRPO διατηρεί το outcome reward: 1 όταν η τελική ετικέτα συμφωνεί με το ground truth και 0 όταν δεν συμφωνεί. Οι ερευνητές προσθέτουν τρία στοιχεία: reward προηγμένης αναζήτησης, Composite Evidence Reward που συνδυάζει ποσότητα και εκτιμώμενη ποιότητα τεκμηρίων και penalty για hallucinated evidence.
Η ποιότητα κάθε claim–evidence pair εκτιμάται ως multiple-choice πρόβλημα από Qwen3.5-4B: supported, refuted ή not enough information. Χρησιμοποιείται η πιθανότητα του αντίστοιχου token και evidence με score έως 0,5 δεν προσμετράται. Ένας παράγοντας κορεσμού αποτρέπει το reward από το να αυξάνεται απεριόριστα μόνο με περισσότερο υλικό.
Η τελική συνάρτηση είναι outcome συν 0,5 φορές το search reward, συν το evidence reward, μείον το hallucination penalty. Το μήνυμα είναι ότι το μοντέλο εκπαιδεύεται στη διαδικασία που θέλουν οι σχεδιαστές, όχι μόνο στο τελικό checkbox. Αν η μόνη επιβράβευση είναι «βρήκες τη σωστή απάντηση», το σύστημα μπορεί να μάθει shortcuts που δεν παράγουν αξιόπιστη τεκμηρίωση.
Πώς ελέγχεται το hallucinated evidence
Η εργασία θεωρεί ένα evidence item hallucinated σε δύο περιπτώσεις. Η πρώτη είναι όταν το PMID δεν ταιριάζει ακριβώς με κάποιο PMID που είχε επιστρέψει το εργαλείο. Η δεύτερη είναι όταν η υποτιθέμενη κορυφαία πρόταση έχει ROUGE-L precision κάτω από 0,85 σε σχέση με το source abstract.
Το penalty υπολογίζεται ως λόγος των hallucinated items προς το σύνολο των evidence items. Η προσέγγιση δεν λύνει κάθε μορφή παραπλανητικής ερμηνείας. Ελέγχει όμως δύο σαφή failure modes: κατασκευασμένη ταυτότητα paper και απόσπασμα που δεν ανταποκρίνεται στο κείμενο που ανακτήθηκε.
Αυτό μεταφέρεται άμεσα σε content operations. Κάθε κρίσιμο claim μπορεί να συνοδεύεται από source ID και ακριβές evidence span. Η λογική συγγενεύει με συστήματα όπου η μνήμη ενός AI agent χρειάζεται provenance, ώστε η επαλήθευση να μην εξαρτάται μόνο από το αν το κείμενο «ακούγεται σωστό».
Τι έδειξαν τα πειράματα σε SciFact και HealthFC
Η εκπαίδευση έγινε στο training split του SciFact με Qwen3.5-4B, για 10 epochs και learning rate 1e-6. Οι ερευνητές αναφέρουν απαίτηση τουλάχιστον τεσσάρων NVIDIA A100 80GB. Η διαδικασία είχε 70 steps και επιλέχθηκε το checkpoint του step 60 βάσει validation reward.
Base BioCheck Agent
Χωρίς reinforcement learning, το Qwen3.5-4B έφτασε accuracy 80,10% στο SciFact και 70,34% στο HealthFC.
SciFact 80,10%HealthFC 70,34%
Με απλό GRPO
Το outcome-only reward ανέβασε το SciFact, αλλά έδωσε μικρότερο κέρδος και χαμηλότερο F1 στο HealthFC.
SciFact 89,01%HealthFC 72,17%
Με EG-GRPO
Το evidence-aware reward έδωσε την καλύτερη accuracy και στα δύο datasets μέσα στη συγκεκριμένη πειραματική διάταξη.
SciFact 90,05%HealthFC 77,37%
Τα βασικά μετρημένα αποτελέσματα
Ακρίβεια και ποιότητα evidence με EG-GRPO
Οι αριθμοί αφορούν τη συγκεκριμένη εργασία, τα επιλεγμένα binary examples και το Qwen3.5-4B· δεν είναι γενικό SLA για biomedical AI.
90,05%Accuracy στο SciFact
77,37%Accuracy στο HealthFC
+3,70 μονάδεςΜεταβολή EQS στο SciFact έναντι base
−19,63%Μείωση EHR που αναφέρει η εργασία
Οι διαφορές accuracy έναντι του base BioCheck Agent είναι 9,95 ποσοστιαίες μονάδες στο SciFact και 7,03 στο HealthFC. Οι συγγραφείς αναφέρουν επίσης ότι το EG-GRPO ξεπέρασε το GPT-5.2 κατά 8,9 ποσοστιαίες μονάδες στο SciFact accuracy. Πρόκειται για αποτέλεσμα της συγκεκριμένης αξιολόγησης και όχι για γενική κατάταξη μοντέλων.
Η διάκριση των datasets είναι κρίσιμη. Το SciFact χρησιμοποιήθηκε για training και evaluation, ενώ το HealthFC μόνο για evaluation. Επιπλέον, τα βασικά πειράματα κράτησαν binary supported/refuted examples. Άρα τα αποτελέσματα δεν αποδεικνύουν ότι το σύστημα καλύπτει όλο το πραγματικό φάσμα αβεβαιότητας.
Η ποιότητα evidence και ο judge model
Εκτός από accuracy, precision, recall και F1, οι ερευνητές εισάγουν το Evidence Quality Score (EQS) και το Evidence Hallucination Rate (EHR). Σε σχέση με το base Qwen3.5-4B, αναφέρουν στο SciFact αύξηση 3,7% στο EQS και μείωση 19,63% στο EHR.
Το baseline GRPO μείωσε ελαφρά τα hallucinations αλλά μείωσε και την ποιότητα evidence. Αυτό υποστηρίζει την κεντρική θέση της εργασίας: η επιβράβευση μόνο της σωστής ετικέτας μπορεί να βελτιώσει το αποτέλεσμα χωρίς να βελτιώσει την αναφορά ως εργαλείο για άνθρωπο.
Υπάρχει πιθανή εξάρτηση από τον judge model, αφού το Qwen3.5-4B χρησιμοποιείται και για evidence confidence. Το ablation με GPT-4o ως εναλλακτικό judge διατήρησε την ίδια τάση. Στο SciFact το EQS ήταν 64,73 για το base, 63,60 με GRPO και 69,92 με EG-GRPO· στο HealthFC 73,83, 71,65 και 75,84.
Οι περιορισμοί του BioCheck Agent
Το σύστημα εξετάζει κυρίως απομονωμένους, ατομικούς ισχυρισμούς. Η πραγματική παραπληροφόρηση εμφανίζεται μέσα σε αφηγήσεις, posts, άρθρα, εικόνες και video. Η εξαγωγή του ακριβούς claim από αυτό το περιβάλλον και η κατανόηση multimodal context παραμένουν ανοιχτές προκλήσεις.
Το SciFact έχει περίπου 500 labeled training examples και, σύμφωνα με την εργασία, δεν περιλαμβάνει περιπτώσεις Not Enough Information στο training set. Στον πραγματικό κόσμο, όμως, η σωστή στάση συχνά δεν είναι «ναι» ή «όχι», αλλά «τα στοιχεία δεν επαρκούν».
Υπάρχει επίσης distribution shift: οι ισχυρισμοί του SciFact προέρχονται από επιστημονικά abstracts, ενώ οι γενικότεροι ισχυρισμοί δημόσιας υγείας του HealthFC είναι διαφορετικοί. Τέλος, οι ίδιοι οι συγγραφείς τοποθετούν το σύστημα ως βοηθητική αναφορά και όχι ως οριστική αρχή ή υποκατάστατο ιατρικής συμβουλής. Για υψηλού ρίσκου περιεχόμενο, το human-in-the-loop πρέπει να σημαίνει πραγματική ανθρώπινη εξουσία, όχι τυπική έγκριση.
Τι σημαίνει για brands και content operations
Η πρακτική ερμηνεία δεν είναι ότι κάθε εταιρεία πρέπει να εκπαιδεύσει biomedical agent. Είναι ότι ένα αξιόπιστο AI workflow χρειάζεται τουλάχιστον τρεις ξεχωριστές στρώσεις: επιλεγμένο corpus, traceable retrieval και αξιολόγηση που τιμωρεί τη μη τεκμηριωμένη παραγωγή.
Για health content, μια ομάδα μπορεί να υιοθετήσει παρόμοιο editorial contract: κάθε claim συνδέεται με ανακτημένη πηγή, τα supporting και refuting στοιχεία δεν συγχωνεύονται πρόωρα, η αβεβαιότητα παραμένει ορατή και ο άνθρωπος εγκρίνει τη δημοσίευση. Οι γενικές οδηγίες δημιουργίας περιεχομένου με AI χρειάζονται αυστηρότερα evidence gates όταν το θέμα αγγίζει την υγεία.
Το δεύτερο μάθημα αφορά τα KPIs. Αν μετράτε μόνο αν το AI παρήγαγε «σωστή» τελική απάντηση, αγνοείτε την ανιχνευσιμότητα, την ποιότητα evidence και το κόστος των ψευδών παραπομπών. Η αξιολόγηση πρέπει να αποτυπώνει το μονοπάτι προς το αποτέλεσμα, όπως ένα αποδεικτικό απόφασης για AI runtime.
Publish gate για περιεχόμενο υγείας
Μην εγκρίνετε το συμπέρασμα αν δεν μπορείτε να αναπαράγετε τα τεκμήρια
Κάθε κρίσιμο claim πρέπει να έχει source ID, ακριβές evidence span, ημερομηνία ανάκτησης, διάκριση supporting/refuting, ορατή αβεβαιότητα και επώνυμο ανθρώπινο reviewer. Αν λείπει ένα από αυτά, το output επιστρέφει για έρευνα αντί να δημοσιεύεται.
Από το paper σε ελέγξιμο editorial workflow
Step 1Ορίστε τον ακριβή ισχυρισμό
Μετατρέψτε την πρόταση του άρθρου σε μία ελέγξιμη δήλωση με πληθυσμό, παρέμβαση, σύγκριση και αποτέλεσμα όπου αυτά είναι σχετικά.
Step 2Κλειδώστε το authoritative corpus
Για biomedical claims ξεκινήστε από PubMed και τις πρωτογενείς μελέτες· μην εξισώνετε promotional pages με peer-reviewed evidence.
Step 3Καταγράψτε κάθε search query
Κρατήστε Boolean query, χρόνο αναζήτησης, αριθμό αποτελεσμάτων και stop reason ώστε η έρευνα να μπορεί να επαναληφθεί.
Step 4Δέστε το evidence στην πηγή
Αποθηκεύστε PMID και ακριβές abstract span για κάθε supporting ή refuting item και απορρίψτε μη επαληθεύσιμες παραπομπές.
Step 5Κρατήστε χωριστές τις δύο πλευρές
Μην αφήσετε την αρχική υπόθεση να εξαφανίσει αντίθετα ευρήματα πριν ο reviewer δει τη συνολική εικόνα.
Step 6Εμφανίστε την αβεβαιότητα
Χρησιμοποιήστε Not Enough Information όταν τα στοιχεία δεν επαρκούν και αποφύγετε binary βεβαιότητα που δεν στηρίζει το corpus.
Step 7Δώστε τελική εξουσία στον ειδικό
Ορίστε επώνυμο reviewer, κριτήρια απόρριψης, versioned report και rollback αν αλλάξει η διαθέσιμη επιστημονική γνώση.
Το ουσιαστικό συμπέρασμα
Το BioCheck Agent προτείνει αλλαγή κριτηρίου επιτυχίας. Ο στόχος δεν είναι να κάνει το μοντέλο πιο πειστικό, αλλά να κάνει τη διαδικασία πιο ελέγξιμη. Search queries, PMIDs, source sentences, αντίθετα evidence και σαφές conclusion αποτελούν ενιαίο προϊόν.
Τα πειράματα δείχνουν ότι ένα μικρότερο open-weight μοντέλο μπορεί να βελτιωθεί όταν το reinforcement learning επιβραβεύει όχι μόνο το αποτέλεσμα αλλά και την τεκμηρίωση. Ταυτόχρονα, binary benchmarks και abstracts δεν ισοδυναμούν με όλη την πολυπλοκότητα της δημόσιας υγείας.
Για τις επιχειρήσεις, η χρήσιμη αρχή είναι σαφής: ένα AI σύστημα υψηλού ρίσκου πρέπει να μπορεί να αποδείξει από πού προήλθε κάθε κρίσιμο στοιχείο και να αφήνει χώρο για ανθρώπινη κρίση. Η τεχνολογία γίνεται πιο αξιόπιστη όταν η αβεβαιότητα και τα ίχνη της διαδικασίας παραμένουν ορατά.
AI workflows με πηγές και έλεγχο
Μετατρέψτε το AI content από απάντηση σε ελέγξιμη διαδικασία
Η TWO DOTS σχεδιάζει αυτοματισμούς που συνδέουν authoritative retrieval, source IDs, evidence spans, human review και publish gates, ώστε το AI να βοηθά την ομάδα χωρίς να κρύβει την αβεβαιότητα.
Είναι ερευνητικός LLM agent που αναζητά βιοϊατρική βιβλιογραφία στο PubMed και παράγει δομημένη αναφορά με supporting evidence, refuting evidence, summary και conclusion.
Τι διαφορά έχει από ένα απλό RAG σύστημα;
Εκτελεί επαναληπτική agentic search, αποφασίζει αν χρειάζεται νέα αναζήτηση και εκπαιδεύεται με rewards για Boolean queries, ποιότητα evidence και αποφυγή hallucinations.
Τι είναι το EG-GRPO;
Είναι η Evidence-Grounded παραλλαγή του GRPO που συνδυάζει reward σωστής ετικέτας με rewards αναζήτησης και evidence, αφαιρώντας penalty για κατασκευασμένα τεκμήρια.
Πώς εντοπίζεται ένα hallucinated evidence item;
Το σύστημα ελέγχει αν το PMID υπάρχει στα ανακτημένα αποτελέσματα και αν η παρατιθέμενη πρόταση έχει ROUGE-L precision τουλάχιστον 0,85 έναντι του abstract.
Ποια datasets χρησιμοποιήθηκαν;
Το SciFact χρησιμοποιήθηκε για εκπαίδευση και αξιολόγηση, ενώ το HealthFC χρησιμοποιήθηκε για αξιολόγηση της μεταφοράς σε γενικότερους ισχυρισμούς υγείας.
Τι accuracy πέτυχε το EG-GRPO;
Με Qwen3.5-4B έφτασε 90,05% στο SciFact και 77,37% στο HealthFC, μέσα στη συγκεκριμένη binary πειραματική διάταξη της εργασίας.
Μπορεί να αντικαταστήσει γιατρό ή fact-checker;
Όχι. Οι συγγραφείς το παρουσιάζουν ως βοηθητικό εργαλείο αναφοράς και όχι ως οριστική αρχή ή υποκατάστατο ιατρικής συμβουλής.
Τι πρέπει να κρατήσει μια ομάδα περιεχομένου;
Να συνδέει κάθε κρίσιμο claim με source ID και evidence span, να κρατά χωριστά τα αντίθετα στοιχεία και να απαιτεί ανθρώπινη έγκριση πριν από τη δημοσίευση.