Causal RAG: όταν η ομοιότητα λέξεων δεν βρίσκει τη σωστή απάντηση

Το causal RAG reranking ξεχωρίζει answer-bearing evidence από keyword-stuffed έγγραφα, αλλά χρειάζεται calibration επειδή αποτυγχάνει σε factoid corpora.

Απάντηση πρώτα: το causal RAG reranking μπορεί να βοηθήσει όταν ένα εταιρικό σύστημα αναζήτησης ανεβάζει έγγραφα που επαναλαμβάνουν τις λέξεις της ερώτησης αλλά δεν περιέχουν την απάντηση. Η μέθοδος αφαιρεί από κάθε υποψήφιο το κοινό λεξιλόγιο με το query και εξετάζει αν οι όροι που απομένουν συνδέονται με το ζητούμενο evidence.

Δεν είναι καθολική αναβάθμιση του retrieval. Στη μελέτη απέδωσε σε keyword-stuffing περιβάλλον, αλλά υποχώρησε έντονα σε τρία γενικά BEIR benchmarks. Για μια επιχείρηση, το ώριμο συμπέρασμα είναι συγκεκριμένο: ενεργοποίηση μόνο μετά από labeled probes στο δικό της corpus, σύγκριση με το baseline και ασφαλές fallback όταν το όφελος δεν αποδεικνύεται.

Περιεχόμενα

Γιατί το similarity μπορεί να επιλέξει λάθος έγγραφο

Ένα τυπικό RAG σύστημα μετατρέπει την ερώτηση και τα έγγραφα σε embeddings, υπολογίζει cosine similarity και κρατά τα καλύτερα υποψήφια. Μπορεί έπειτα να προσθέσει cross-encoder reranker. Η λογική είναι εύλογη: ένα σχετικό έγγραφο θα πρέπει να βρίσκεται κοντά σημασιολογικά στην ερώτηση. Όμως η ομοιότητα μετρά αν δύο κείμενα μιλούν για παρόμοιο θέμα, όχι αν το ένα περιέχει τα στοιχεία που χρειάζονται για τη σωστή απάντηση.

Η εργασία From Association to Causation ξεκινά από ένα εταιρικό παράδειγμα για την αξιολόγηση ασφάλειας διασυνοριακής μεταφοράς δεδομένων. Έγγραφα για automotive data ανέβηκαν ψηλά επειδή επαναλάμβαναν συχνά όρους όπως «data», «cross-border», «security» και «assessment». Η οδηγία που περιείχε τη ζητούμενη διαδικασία έμεινε στην έκτη θέση, επειδή εξηγούσε τα βήματα με πιο λειτουργικό και εξειδικευμένο λεξιλόγιο.

Για μια επιχείρηση, αυτό είναι πρόβλημα προϊόντος και όχι μόνο ranking metric. Αν το λάθος evidence μπει στο prompt, ακόμη και ένα ισχυρό LLM περιορίζεται από ανεπαρκές context. Η αξιόπιστη απάντηση ξεκινά από την ανάκτηση, όπως φαίνεται και στην πρακτική αρχιτεκτονική ενός private chatbot με RAG πάνω στην εταιρική γνώση.

Τι είναι πραγματικά το causal RAG reranking

Η πρόταση δεν κατασκευάζει γράφο αιτίων μέσα στα έγγραφα και δεν ζητά από LLM να ακολουθήσει causal paths. Μοντελοποιεί τη διαδικασία retrieval. Για κάθε ανακτημένο έγγραφο, το λανθάνον σύνολο A περιλαμβάνει τους όρους που μοιράζονται η ερώτηση και το έγγραφο, είτε με ακριβή αντιστοίχιση είτε με σημασιολογική εγγύτητα. Το B περιλαμβάνει το υπολειπόμενο, σταθμισμένο λεξιλόγιο του εγγράφου.

Στο γράφημα των συγγραφέων, το A λειτουργεί ως κοινή αιτία της ερώτησης και του εγγράφου, ενώ το B συνδέει το έγγραφο με την ιδανική απάντηση. Το ανακτημένο έγγραφο είναι collider στη δομή A → d ← B. Η επιλογή του ως υποψηφίου «ανοίγει» μια συσχέτιση ανάμεσα στην ερώτηση και το B, την οποία η μέθοδος χρησιμοποιεί ως κίνητρο για νέο score.

Η ονομασία χρειάζεται προσοχή. Οι συγγραφείς δηλώνουν ρητά ότι δεν εκτιμούν causal effect και ότι το score δεν είναι ταυτοποιημένο causal estimand. Ο γράφος παρέχει δομική και motivational δικαιολόγηση· το αν η ιδέα δουλεύει κρίνεται από τα πειράματα.

Similarity baseline

Ανταμείβει τη συνολική σημασιολογική εγγύτητα και μπορεί να παρασυρθεί όταν άσχετα έγγραφα επαναλαμβάνουν το query vocabulary.

ΓρήγοροΙσχυρό baseline

Cross-encoder

Βαθμολογεί query και έγγραφο μαζί. Στο μικρό diagnostic corpus βελτίωσε λίγο το target rank, αλλά δεν έλυσε το keyword-stuffing failure.

Supervised2,63 mean rank

Causal ή hybrid

Βαθμολογεί το residual vocabulary B και μπορεί να συνδυαστεί με similarity, αλλά πρέπει να ενεργοποιείται μόνο σε corpus όπου το όφελος μετριέται.

Training-freeCalibration first

Πώς λειτουργεί το attention-style score χωρίς νέο training

Η διαδικασία εφαρμόζεται πάνω στο ήδη μικρό candidate set του retriever. Ένας keyword extractor παράγει σταθμισμένους όρους για το query και κάθε υποψήφιο έγγραφο. Όσοι όροι του εγγράφου ταιριάζουν ακριβώς ή σημασιολογικά με το query vocabulary περνούν στο A. Στα πειράματα χρησιμοποιήθηκε threshold σημασιολογικής απορρόφησης 0,6.

Για τους όρους που απομένουν στο B υπολογίζεται weighted centroid embedding. Το causal-attention score είναι η cosine similarity ανάμεσα στο embedding της ερώτησης και αυτό το centroid. Ένα έγγραφο που απλώς επαναλαμβάνει τις λέξεις της ερώτησης έχει μικρό ή φτωχό B και τείνει να υποβαθμιστεί. Ένα έγγραφο του οποίου το residual vocabulary περιγράφει τη διαδικασία ή το answer-bearing στοιχείο μπορεί να ανέβει.

Η μέθοδος δεν απαιτεί fine-tuning και, σύμφωνα με την προτεινόμενη ροή, δεν προσθέτει LLM call την ώρα της ερώτησης. Προσθέτει keyword extraction και embeddings για δεκάδες residual terms σε candidate set μονοψήφιου ή χαμηλού διψήφιου μεγέθους. Αυτό μπορεί να είναι μικρό σε σχέση με το αρχικό retrieval, αλλά δεν αποτελεί καθολική υπόσχεση latency για κάθε υποδομή.

Γιατί χρειάζεται semantic absorption

Η exact-match εκδοχή αφαιρούσε από το B μόνο τους όρους που ταίριαζαν αυτούσιοι με το query. Το πρόβλημα είναι ότι ένα distractor μπορεί να χρησιμοποιεί συνώνυμα ή γειτονική ορολογία και να κρατά στο B αρκετό επιφανειακό σήμα ώστε να βαθμολογηθεί ψηλά. Η semantic absorption μεταφέρει στο A και τους όρους που είναι κοντά στα query terms στο embedding space.

Στο ελεγχόμενο corpus, η exact-match παραλλαγή είχε ασυνεπή συμπεριφορά. Η semantic παραλλαγή έφερε το answer-bearing έγγραφο στην πρώτη ή δεύτερη θέση και στα οκτώ θέματα. Η μέση θέση βελτιώθηκε από 2,88 στο similarity baseline σε 1,25, ενώ η μέση θέση των δύο keyword-stuffed distractors ανά θέμα μετακινήθηκε από 2,00 σε 4,50.

Το hybrid score, με ίσο βάρος σε κανονικοποιημένο similarity και causal-attention score, έφτασε μέση θέση 1,38 και στα συγκεκριμένα runs δεν έβαλε το target χαμηλότερα από το baseline. Αυτό είναι επιχείρημα για προσεκτική συνένωση σημάτων, όπως συμβαίνει και στο hybrid AI search που συνδυάζει λέξεις, embeddings και fallbacks, όχι απόδειξη ότι ένα fixed 50/50 βάρος είναι βέλτιστο παντού.

Τι έδειξε η πραγματική βάση γνώσης των 471 εγγράφων

Το deployment case study χρησιμοποίησε 471 τοπικά αρχεία συνολικού μεγέθους 2,95 GB: νόμους, κανονισμούς, εσωτερικές αναφορές, επαγγελματικά βιβλία και papers σε Word και PDF. Τα αρχεία καθαρίστηκαν, χωρίστηκαν σε chunks 4.096 χαρακτήρων με overlap 512 και ενσωματώθηκαν με BGE-M3 σε vectors 1.024 διαστάσεων.

Στην ερώτηση για την ασφάλεια διασυνοριακής μεταφοράς, η κατάλληλη οδηγία ανέβηκε από την έκτη θέση στο top 3. Το αποτέλεσμα αποδεικνύει ότι ο μηχανισμός διόρθωσε ένα πραγματικό failure μέσα σε αυτό το συγκεκριμένο corpus. Δεν είναι στατιστική απόδειξη γενικής υπεροχής: πρόκειται για επιλεγμένο case study, ενώ η ελεγχόμενη ποσοτική διερεύνηση προέρχεται από τα επόμενα πειράματα.

Το σενάριο είναι αναγνωρίσιμο σε knowledge managers. Καθώς συσσωρεύονται versions, policy notes, παρουσιάσεις και παρόμοια manuals, η θεματική γειτνίαση αυξάνεται. Η retrieval αρχιτεκτονική πρέπει τότε να διακρίνει το «μιλά για το ίδιο θέμα» από το «περιέχει τη διαδικασία που ζητήθηκε». Τεχνικές συμπίεσης, όπως τα Semantic Compression Trees για λιγότερο RAG context, λύνουν διαφορετικό μέρος του προβλήματος και δεν υποκαθιστούν την επιλογή σωστού evidence.

Το diagnostic test για keyword stuffing

Για γνωστό ground truth, οι ερευνητές κατασκεύασαν μικρό συνθετικό corpus οκτώ θεμάτων, πέντε στα κινεζικά και τρία στα αγγλικά. Κάθε θέμα είχε ένα answer-bearing target, near-relevant κείμενα, δύο σκόπιμα keyword-stuffed distractors και άσχετα έγγραφα. Τα θέματα κάλυπταν data-transfer security, θεραπείες παραδοσιακής κινεζικής ιατρικής, Wason selection task, καθαρισμό LLM pretraining data, privacy impact assessment, ColBERT και SPLADE.

Ο BGE-reranker-v2-m3 cross-encoder βελτίωσε τη μέση θέση του target μόνο από 2,88 σε 2,63 και άφησε τους distractors κοντά στην κορυφή. Η semantic causal παραλλαγή έφτασε 1,25. Το αποτέλεσμα δείχνει ότι η τεχνική επιλύει τον failure mode για τον οποίο σχεδιάστηκε, όχι ότι υπερέχει σε κάθε retrieval workload.

Τεκμηριωμένη εικόνα

Τέσσερις αριθμοί που ορίζουν το εύρος της μεθόδου

Οι τιμές προέρχονται από διαφορετικά πειράματα της ίδιας μελέτης και πρέπει να διαβάζονται μαζί με το αντίστοιχο corpus.

471έγγραφα στο enterprise case study
2,88 → 1,25mean target rank στο diagnostic corpus
2,00 → 4,50mean distractor rank, χαμηλότερα είναι καλύτερα για το target
30probes για ≥95% σωστή απενεργοποίηση στα BEIR tests

Πηγή: arXiv 2608.21702 v1, πίνακες 2–4.

Τα αρνητικά αποτελέσματα στα BEIR benchmarks αλλάζουν το συμπέρασμα

Στα SciFact, NFCorpus και ArguAna του BEIR, το causal score υποαπέδωσε καθαρά. Στο SciFact, το baseline είχε nDCG@10 0,642, ο cross-encoder 0,716 και το causal score 0,157. Στο NFCorpus οι αντίστοιχες τιμές ήταν 0,317, 0,337 και 0,136. Στο ArguAna ήταν 0,398, 0,470 και 0,213.

Η εξήγηση είναι εύλογη: σε factoid-style corpora, το σωστό έγγραφο συχνά χρησιμοποιεί ακριβώς το content vocabulary της ερώτησης. Αν αυτό το λεξιλόγιο απορροφηθεί στο A, το B μπορεί να μείνει με όρους διακριτούς αλλά όχι answer-bearing. Το score τότε ανταμείβει κείμενα που είναι θεματικά γειτονικά χωρίς να αποτελούν την καλύτερη απόδειξη.

Ο cross-encoder και το causal score δεν είναι απλοί ανταγωνιστές. Ο πρώτος είναι ισχυρός όταν η soft semantic relevance είναι αξιόπιστο σήμα. Το δεύτερο στοχεύει περιβάλλοντα όπου αυτό το σήμα μολύνεται από repetition και topic-near distractors. Η σωστή ερώτηση είναι «σε ποιο corpus regime λειτουργεί ο καθένας;», όχι «ποιος reranker κερδίζει γενικά;».

Το calibration gate πριν από την παραγωγή

Οι συγγραφείς δοκίμασαν τρεις φθηνούς per-query δείκτες πάνω στα top-10 candidates: keyword overlap, ποσοστό βάρους που απορροφάται στο A και normalized gap ανάμεσα στα δύο υψηλότερα similarity scores. Κανένας δεν ξεχώρισε αξιόπιστα το keyword-stuffing από το factoid regime. Η σχέση ανάμεσα στο keyword-driven ranking και την πραγματική relevance δεν είναι ορατή χωρίς labels.

Η πρακτική πρόταση είναι corpus-level offline calibration. Η ομάδα δειγματοληπτεί queries, σημειώνει το σωστό evidence με ανθρώπινη ή ελεγχόμενη LLM κρίση, συγκρίνει baseline και νέο ranking και ενεργοποιεί το reranker μόνο αν η διαφορά είναι θετική. Με 2.000 bootstrap draws, 30 probes έδωσαν τουλάχιστον 95% αξιοπιστία για τη σωστή απόφαση απενεργοποίησης στα τρία BEIR datasets. Στο μικρό diagnostic corpus, τέσσερα probes έδωσαν 100% αξιοπιστία ενεργοποίησης.

Οι αριθμοί αφορούν αυτά τα δεδομένα. Δεν εγγυώνται ότι 30 probes αρκούν σε κάθε οργανισμό. Το sample πρέπει να εκπροσωπεί το corpus και τα πραγματικά intents, ενώ μια βάση γνώσης που αλλάζει χρειάζεται περιοδικό recalibration. Η αρχιτεκτονική αξία βρίσκεται στο release gate και στο fallback, όχι σε ένα one-off benchmark.

Κανόνας ενεργοποίησης

Χωρίς labeled probes, κρατήστε το baseline

Το causal RAG reranking πρέπει να περάσει offline σύγκριση στο πραγματικό corpus, ανά συλλογή ή use case. Αν το confidence interval δεν δείχνει καθαρό όφελος, χρησιμοποιήστε similarity ή hybrid fallback και συνεχίστε τη μέτρηση.

Κόστος, ιδιωτικότητα και τεχνικές εξαρτήσεις

Η reference υλοποίηση ξαναχτίστηκε τοπικά με Qwen3-4B ως generator και translation module και BGE-M3 για embeddings. Περιλαμβάνει parsing Word/PDF, cleaning, chunking, thresholded retrieval, μετάφραση chunks και prompt generation. Ο κώδικας του testbed και των πειραμάτων διατίθεται δημόσια από τους συγγραφείς.

Η τοπική λειτουργία είναι χρήσιμη για οργανισμούς που δεν μπορούν να στείλουν νομικά, κανονιστικά ή εσωτερικά έγγραφα σε εξωτερικές υπηρεσίες. Δεν σημαίνει plug-and-play. Η ποιότητα εξαρτάται από keyword extractor, βάρη, absorption threshold, embedding model, chunking, candidate window και τρόπο συνδυασμού των scores. Η εργασία αναγνωρίζει ότι απαιτείται πληρέστερο ablation αυτών των επιλογών.

Το retrieval pipeline χρειάζεται επίσης ιχνηλασιμότητα. Η λογική του field-aware RAG και του ελεγχόμενου schema routing δείχνει γιατί τα permissions και το scope της ανάκτησης είναι εξίσου σημαντικά με το ranking. Αν ο agent μπορεί να αναζητήσει λάθος συλλογή ή να χρησιμοποιήσει μη εγκεκριμένο έγγραφο, καλύτερο reranking δεν διορθώνει το governance gap.

Τι σημαίνει για ένα επιχειρησιακό RAG

Για customer support, e-commerce operations, compliance και internal search, η ομάδα πρέπει να μετρά αν το σωστό chunk φτάνει στο prompt. Answer quality χωρίς retrieval trace κρύβει το failure: μια καλή απάντηση μπορεί να προέρχεται από prior knowledge του μοντέλου, ενώ μια λανθασμένη απάντηση μπορεί να οφείλεται σε λάθος evidence και όχι στον generator.

Η observability πρέπει να καταγράφει query, αρχικό rank, νέο rank, μέγεθος A/B, source IDs, evidence που μπήκε στο prompt και outcome από reviewer ή downstream task. Η ίδια αρχή provenance που χρειάζεται η μνήμη ενός AI agent με αποδείξεις ισχύει και εδώ: χωρίς σύνδεση ανάμεσα σε claim και πηγή, η ομάδα δεν μπορεί να ξεχωρίσει βελτίωση από τυχαία επιτυχία.

Το operating model χρειάζεται owner, cadence επαναξιολόγησης και stop condition. Οι πρακτικές των enterprise AI harnesses και των ελεγκτικών αποδείξεων σε AI runtimes είναι συναφείς: το ranking change πρέπει να παράγει τεκμηριωμένο artifact, όχι να παραμένει αόρατη επιλογή μέσα σε μια αλυσίδα.

Επτά βήματα για ασφαλές pilot

Ένα pilot μπορεί να είναι μικρό, αλλά πρέπει να δοκιμάζει το πραγματικό corpus και τα πραγματικά intents. Το ζητούμενο δεν είναι να αναπαραχθεί ολόκληρη η μελέτη· είναι να αποδειχθεί αν υπάρχει όντως keyword-stuffing regime και αν η αλλαγή βελτιώνει την evidence retrieval χωρίς να βλάπτει τις υπόλοιπες ερωτήσεις.

Από το retrieval failure σε ελεγχόμενη απόφαση

  1. Βήμα 1Ορίστε το failure mode

    Συλλέξτε queries όπου topic-near ή keyword-heavy έγγραφα εκτοπίζουν το answer-bearing evidence από το prompt.

  2. Βήμα 2Χτίστε αντιπροσωπευτικό probe set

    Δειγματοληπτήστε πραγματικά intents ανά συλλογή, γλώσσα και ρόλο χρήστη, όχι μόνο εύκολες ερωτήσεις επίδειξης.

  3. Βήμα 3Καταγράψτε relevance labels

    Ζητήστε από domain reviewers να σημειώσουν ποιο έγγραφο ή chunk περιέχει το στοιχείο που απαιτεί η απάντηση.

  4. Βήμα 4Μετρήστε τέσσερις διαδρομές

    Συγκρίνετε similarity baseline, υπάρχον cross-encoder, causal score και hybrid με MRR ή nDCG και με evidence-in-prompt success.

  5. Βήμα 5Βάλτε corpus-level gate

    Ενεργοποιήστε τη νέα κατάταξη μόνο όταν η διαφορά είναι θετική και το uncertainty παραμένει μέσα στο αποδεκτό όριο.

  6. Βήμα 6Κρατήστε fallback και traces

    Αποθηκεύστε ranks, A/B diagnostics και source IDs και επιστρέψτε στο baseline όταν το B είναι κενό, ασταθές ή εκτός calibrated scope.

  7. Βήμα 7Επαναξιολογήστε όταν αλλάζει το corpus

    Νέα έγγραφα, νέες εκδόσεις και νέα intents μπορούν να μετακινήσουν το regime· προγραμματίστε περιοδικά probes και rollback criteria.

Το NIST AI RMF τοποθετεί τη μέτρηση και τη διαχείριση μέσα σε συνεχή κύκλο Govern, Map, Measure και Manage. Για ένα RAG σύστημα αυτό σημαίνει documented scope, testing πριν από deployment, monitoring στην παραγωγή και σαφή απόφαση για το πότε η τεχνική πρέπει να απενεργοποιηθεί.

Περιορισμοί και πρακτικό συμπέρασμα

Η εργασία είναι preprint 16 σελίδων, έκδοση v1 της 22ας Αυγούστου 2026. Το enterprise corpus είναι ιδιωτικό και το κύριο θετικό ποσοτικό πείραμα είναι μικρό και συνθετικό. Το calibration result βασίζεται σε bootstrap πάνω στα διαθέσιμα scores, όχι σε πολυάριθμες ανεξάρτητες παραγωγικές εγκαταστάσεις.

Η μέθοδος εξαρτάται από την ποιότητα του keyword extraction και από την υπόθεση ότι το residual vocabulary B φέρει το answer-bearing σήμα. Σε factoid corpora αυτή η υπόθεση απέτυχε. Η συνένωση με similarity, τα thresholds και το routing ανά collection παραμένουν ανοικτές σχεδιαστικές επιλογές που χρειάζονται domain-specific validation.

Το ώριμο συμπέρασμα είναι χρήσιμο ακριβώς επειδή δεν είναι εντυπωσιακά απόλυτο. Το causal RAG reranking αξίζει δοκιμή όταν η εταιρική γνώση έχει πολλά παρόμοια documents και εμφανίζει false positives γεμάτα query terms. Αξίζει παραγωγική ενεργοποίηση μόνο όταν labeled probes αποδεικνύουν όφελος στο συγκεκριμένο corpus. Η καλύτερη retrieval καινοτομία δεν είναι αυτή που αλλάζει κάθε ranking· είναι αυτή που ξέρει πότε πρέπει να κρατήσει το baseline.

RAG με μετρήσιμη ποιότητα evidence

Σχεδιάστε AI αναζήτηση που ξέρει πότε να κρατά το baseline

Η TWO DOTS συνδέει εταιρικές βάσεις γνώσης, AI assistants και αυτοματισμούς με retrieval evaluation, permissions, monitoring, ασφαλή fallbacks και ανθρώπινη εποπτεία.

Συχνές ερωτήσεις

Τι είναι το causal RAG reranking αυτής της μελέτης;

Είναι training-free επαναβαθμολόγηση του ήδη ανακτημένου candidate set με βάση το residual vocabulary ενός εγγράφου, αφού αφαιρεθούν οι όροι που επικαλύπτονται με την ερώτηση.

Εκτιμά πραγματικό causal effect;

Όχι. Οι συγγραφείς παρουσιάζουν τον causal γράφο ως δομικό και motivational πλαίσιο. Το score είναι heuristic και όχι ταυτοποιημένο causal estimand.

Πότε μπορεί να βοηθήσει περισσότερο;

Όταν ένα εταιρικό corpus έχει πολλά topic-near ή keyword-heavy έγγραφα που ανεβαίνουν ψηλά χωρίς να περιέχουν το answer-bearing evidence.

Σε ποια δεδομένα απέτυχε;

Υποαπέδωσε απέναντι στο similarity baseline στα SciFact, NFCorpus και ArguAna, όπου η κοινή ορολογία query και σωστού εγγράφου είναι χρήσιμο relevance signal.

Προσθέτει νέο LLM call στο query time;

Όχι στην προτεινόμενη ροή. Προσθέτει keyword extraction και embedding/scoring των residual terms πάνω στο ήδη μικρό candidate set.

Γιατί χρειάζεται semantic absorption;

Επειδή η ακριβής αντιστοίχιση αφήνει συνώνυμα και γειτονικούς όρους των distractors μέσα στο B. Η σημασιολογική απορρόφηση μεταφέρει αυτούς τους όρους στο A.

Πώς αποφασίζει μια ομάδα αν πρέπει να το ενεργοποιήσει;

Με αντιπροσωπευτικά labeled probes, σύγκριση baseline και νέου ranking και corpus-level gate που ενεργοποιεί τη μέθοδο μόνο όταν το μετρημένο όφελος είναι θετικό.

Ποια είναι η ασφαλέστερη επιλογή σε άγνωστο corpus;

Να παραμείνει ενεργό το similarity baseline ή ένα μετρημένο hybrid fallback μέχρι offline calibration στο πραγματικό corpus να αποδείξει καθαρό όφελος.

Ενημερωτικό Δελτίο

Εισάγετε τη διεύθυνση email σας παρακάτω για να εγγραφείτε στο ενημερωτικό δελτίο μας