DASO: πώς η AI μαθαίνει να προτείνει το σωστό προϊόν χωρίς να χάνει τον δρόμο

Το DASO χρησιμοποιεί Semantic IDs, online prefix profiling και guided rollouts για να ενισχύσει τα target-missing prompts στο generative recommendation.

Το DASO είναι μια μέθοδος post-training για generative recommendation με Semantic IDs. Αντί να αντιμετωπίζει κάθε λανθασμένη πρόταση ως ίδιο μηδενικό αποτέλεσμα, μετρά πόσο βαθιά ακολούθησε το μοντέλο τη σωστή ιεραρχική διαδρομή προϊόντος και κατευθύνει περιορισμένα rollouts στο σημείο όπου η ομάδα χάνει τον στόχο.

Στα δύο δημόσια Amazon benchmarks του paper, το DASO βελτίωσε το MiniOneRec-style GRPO σε 11 από 12 metrics και είχε την καλύτερη επίδοση σε 9 από 12. Αυτό είναι τεχνικό αποτέλεσμα recommendation accuracy από single runs, όχι απόδειξη αύξησης πωλήσεων. Για ένα e-shop, η πρακτική αξία βρίσκεται στη διάγνωση του failure mode, στη σωστή δομή του καταλόγου και σε ένα ελεγχόμενο offline-to-online πείραμα.

Contents

Από το ranking στη δημιουργία Semantic IDs

Τα κλασικά recommendation systems συνήθως ανακτούν ένα σύνολο υποψήφιων προϊόντων και στη συνέχεια τα κατατάσσουν. Στο generative recommendation, το μοντέλο λαμβάνει το ιστορικό ή άλλο context του χρήστη και παράγει απευθείας το αναγνωριστικό του επόμενου item. Η πρόταση μετατρέπεται έτσι σε autoregressive generation μιας μικρής ακολουθίας tokens.

Για να παραμένει διαχειρίσιμος ένας μεγάλος κατάλογος, κάθε προϊόν μπορεί να αναπαρασταθεί από ένα Semantic ID: μια σύντομη, ιεραρχική ακολουθία διακριτών κωδικών. Τα πρώτα επίπεδα επιδιώκεται να εκφράζουν ευρύτερη σημασιολογική συγγένεια και τα επόμενα να εξειδικεύουν την επιλογή. Στα δημόσια πειράματα του DASO τα IDs έχουν τρία επίπεδα με έως 256 κωδικούς ανά επίπεδο. Στο εσωτερικό βιομηχανικό dataset έχουν τέσσερα επίπεδα και έως 2.048 κωδικούς ανά επίπεδο.

Η ιεραρχία δημιουργεί πληροφορία που ένα απλό item ID δεν έχει. Αν η πρόβλεψη αποτύχει στο πρώτο token, εισέρχεται σε λάθος υποδέντρο. Αν πετύχει τα πρώτα δύο tokens αλλά χάσει το τρίτο, βρίσκεται πολύ πιο κοντά στον στόχο. Ένα binary reward που ελέγχει μόνο το τελικό item αγνοεί αυτή τη διαφορά, ενώ το DASO τη χρησιμοποιεί ως ενδιάμεσο training signal.

Κλασικό retrieve και rank

Το σύστημα ανακτά υποψηφίους και βαθμολογεί μια προκαθορισμένη λίστα προϊόντων σε χωριστά στάδια.

CandidatesRanking

Generative Semantic ID

Το μοντέλο παράγει μια έγκυρη διαδρομή tokens μέσα στον ιεραρχικό κατάλογο και τη μετατρέπει σε item.

SID treeConstrained decoding

DASO post-training

Το prefix depth δείχνει πού χάνεται ο στόχος, ώστε το guidance να κατευθύνεται μόνο στα προβληματικά επίπεδα.

Online profileBounded guidance

Η διαφορά έχει σημασία για την αρχιτεκτονική ενός e-shop. Η ποιότητα της εξατομίκευσης δεν εξαρτάται μόνο από το μέγεθος του μοντέλου. Εξαρτάται από την αναπαράσταση του καταλόγου, τη σταθερότητα των item mappings, τη συνέπεια του user context και το πώς ορίζεται το reward. Αυτό συνδέεται άμεσα με τις πλατφόρμες εξατομίκευσης για επιχειρήσεις, αλλά προϋποθέτει πολύ πιο ειδική υποδομή από ένα έτοιμο recommendation widget.

Γιατί το GRPO μπορεί να μείνει χωρίς χρήσιμο σήμα

Η συνταγή που εξετάζουν οι συγγραφείς ξεκινά με supervised fine-tuning (SFT) και συνεχίζει με Group Relative Policy Optimization (GRPO). Για κάθε prompt, το GRPO παράγει μια ομάδα πιθανών απαντήσεων, αποδίδει reward σε καθεμία και ενισχύει όσες είναι καλύτερες από τον μέσο όρο της ομάδας. Η σύγκριση λειτουργεί όταν τα rewards έχουν ουσιαστική διακύμανση.

Το πρόβλημα εμφανίζεται όταν κανένα rollout δεν φτάνει στο σωστό item. Με καθαρά item-level reward, πολλές ή όλες οι απαντήσεις μπορούν να πάρουν το ίδιο μηδενικό αποτέλεσμα. Τότε τα group-relative advantages πλησιάζουν το μηδέν και το policy gradient δεν ξεχωρίζει μια πρόβλεψη που βρήκε το σωστό πρώτο επίπεδο από μια πρόβλεψη που βγήκε αμέσως σε άσχετο κλάδο.

Στο frozen SFT checkpoint, οι πρώτοι 16 υποψήφιοι ενός constrained ranking 50 beams δεν περιείχαν ούτε match στο πρώτο SID token για το 52,5% έως 63,9% των prompts στα δημόσια test sets. Οι τιμές δεν προέρχονται από τα on-policy training rollouts· είναι prompt-level diagnostic στο παγωμένο checkpoint. Οι συγγραφείς τις χρησιμοποιούν ως ένδειξη ότι ανάλογες target-missing ομάδες μπορεί να είναι συχνές κατά το training.

Για μια product team, αυτή είναι χρήσιμη διαγνωστική αρχή. Πριν προστεθεί σύνθετο reinforcement learning, πρέπει να αποδειχθεί ότι το πρόβλημα είναι όντως η απουσία του target branch και όχι κακή ποιότητα δεδομένων, ασυνεπείς IDs, λανθασμένο catalog taxonomy, ανεπαρκές context ή λάθος offline metric. Η ανάλυση προϊόντων πρέπει να ξεκινά από το πραγματικό failure mode, όχι από την επιλογή μιας εντυπωσιακής μεθόδου.

Πώς το DASO μετρά τη δυσκολία online

Το DASO δεν κολλά μόνιμα την ετικέτα «εύκολο» ή «δύσκολο» σε ένα prompt. Σε κάθε βήμα εκπαίδευσης εξετάζει την τρέχουσα ομάδα rollouts και υπολογίζει το prefix-match depth: το μήκος του μεγαλύτερου αρχικού τμήματος που συμφωνεί με το target Semantic ID. Βάθος μηδέν σημαίνει ότι χάθηκε το πρώτο token· πλήρες βάθος σημαίνει exact hit.

Από τα βάθη δημιουργείται ένα σωρευτικό prefix profile. Η πτώση ανάμεσα σε δύο διαδοχικά επίπεδα δείχνει πού εγκαταλείπουν συχνότερα τη σωστή διαδρομή οι υποψήφιοι. Αν η πτώση βρίσκεται στη ρίζα, το guidance πρέπει να βοηθήσει την είσοδο στο σωστό coarse branch. Αν αρκετά rollouts φτάνουν βαθύτερα, η παρέμβαση μεταφέρεται μετά το κοινό prefix.

Η online μέτρηση είναι ουσιώδης επειδή η δυσκολία μεταβάλλεται μαζί με την policy. Ένα prompt που ήταν δύσκολο στο αρχικό SFT checkpoint μπορεί να γίνει ευκολότερο αργότερα, ενώ ένα στατικό bucket δεν θα το αντιληφθεί. Στις ablations, η static παραλλαγή ήταν χαμηλότερη από το πλήρες DASO στα aggregate HR@5 και NDCG@5 και για τα δύο backbones και datasets.

Το DASO σε τέσσερα επαληθευμένα μεγέθη

Οι τιμές προέρχονται από το paper και αφορούν αποκλειστικά το συγκεκριμένο experimental protocol, όχι εμπορικά KPIs.

16rollouts ανά raw group
9μέγιστο guided budget
11/12metrics πάνω από MiniOneRec GRPO
9/12καλύτερες δημόσιες επιδόσεις

Guided rollouts στο σωστό βάθος

Αν η raw ομάδα περιέχει ήδη το ακριβές target SID, το DASO την αφήνει αμετάβλητη: υπάρχει ήδη αντίθεση ανάμεσα σε σωστές και λανθασμένες επιλογές. Αν λείπει το exact hit, η μέθοδος υπολογίζει ένα budget καθοδήγησης που αυξάνεται όσο μικραίνει το μέσο prefix-match depth, πάντα κάτω από το όριο των 9 θέσεων σε ομάδα 16 rollouts.

Το budget κατανέμεται στα bottleneck depths ανάλογα με τις πτώσεις του prefix profile και με deterministic largest-remainder rounding. Για κάθε guided completion, το σωστό target prefix σταθεροποιείται μέχρι το επιλεγμένο βάθος και η τρέχουσα policy παράγει το υπόλοιπο suffix. Οι guided completions αντικαθιστούν τα πιο αδύναμα raw rollouts, ενώ τα ισχυρότερα διατηρούνται ως on-policy contrast.

Τα forced-prefix tokens αντιμετωπίζονται ως conditioning context, όχι ως actions της policy. Οι likelihood-ratio και KL όροι του GRPO εφαρμόζονται μόνο στα suffix tokens που παρήγαγε το μοντέλο. Έτσι η μέθοδος εισάγει χρήσιμο target-path signal χωρίς να μετατρέπει ολόκληρη την ομάδα σε teacher-forced batch.

Αυτή η ισορροπία είναι πιο σημαντική από την απλή προσθήκη «σωστών απαντήσεων». Στο δημόσιο comparison, το πλήρες DASO ήταν υψηλότερο από την ομοιόμορφη MiniOneRec + GT παραλλαγή σε 11 από 12 metrics. Το αποτέλεσμα συγκρίνει ολόκληρα training frameworks και δεν απομονώνει μόνο τον allocator, αλλά δείχνει γιατί η θέση και η ποσότητα του guidance αξίζουν ξεχωριστό σχεδιασμό.

Reward για τη μερική πρόοδο

Το DASO διατηρεί τον item-accuracy reward και το rank-aware συστατικό του MiniOneRec με βάρος 0,3. Προσθέτει έναν SID-prefix reward: το matched depth διαιρείται με το συνολικό βάθος του Semantic ID. Μια πρόβλεψη που ακολουθεί μεγαλύτερο μέρος της σωστής διαδρομής παίρνει περισσότερο credit από μία που αποτυγχάνει στο πρώτο επίπεδο.

Το prefix credit δεν αντικαθιστά τον τελικό στόχο. Η ακριβής επιλογή item παραμένει ξεχωριστός reward, επομένως ένα ρηχό prefix δεν μπορεί μόνο του να μεγιστοποιήσει το συνολικό αποτέλεσμα. Ο ρόλος του είναι να σπάει την ισοπαλία στις target-missing ομάδες, όταν το binary feedback θα ήταν σιωπηλό.

Η αφαίρεση του SID-prefix reward μείωσε και τα 12 aggregate metric entries που παρουσιάζει η σχετική ablation. Οι διαφορές δεν αποδεικνύουν ότι το prefix term είναι η μοναδική αιτία της βελτίωσης. Υποστηρίζουν ότι λειτουργεί μαζί με το online profiling, το περιορισμένο guidance και το SFT anchor.

Το SFT anchor ως μηχανισμός σταθερότητας

Η καθοδήγηση αυξάνει την plasticity, αλλά αλλάζει μέρος της κατανομής προς target-prefixed trajectories. Αυτό μπορεί να δημιουργήσει drift και να χειροτερέψει prompts που το αρχικό SFT checkpoint έλυνε ήδη. Για να περιορίσει την παλινδρόμηση, το DASO προσθέτει token-level supervised loss πάνω στη σωστή SID ακολουθία, με βάρος 0,1 στα αναφερόμενα πειράματα.

Χωρίς το SFT anchor, το aggregate HR@5 έπεσε και στις τέσσερις δημόσιες ρυθμίσεις. Τα Easy-bucket αποτελέσματα ήταν μικτά: σε μία ρύθμιση η παραλλαγή χωρίς anchor ήταν υψηλότερη. Η ασφαλής ερμηνεία είναι συνολική σταθεροποίηση, όχι εγγύηση ότι κάθε εύκολο prompt προστατεύεται πάντα.

Η αρχή γενικεύεται προσεκτικά σε production personalization. Όταν μια ομάδα βελτιστοποιεί μόνο τα failures, πρέπει να ελέγχει αν μεταφέρει το κόστος σε προϊόντα, κατηγορίες ή χρήστες που λειτουργούσαν σωστά. Regression suites ανά segment, shadow evaluation και rollback criteria είναι εξίσου σημαντικά με το νέο objective. Η ίδια πειθαρχία εμφανίζεται στην αξιόπιστη αξιολόγηση AI: το συνολικό score δεν αρκεί χωρίς κάλυψη και ανάλυση αποτυχιών.

Τι έδειξαν τα πειράματα

Οι συγγραφείς αξιολόγησαν Qwen2.5-1.5B-Instruct και Qwen2.5-3B-Instruct στα Amazon Reviews 2018 Office Products και Industrial and Scientific. Όλες οι μέθοδοι ξεκίνησαν από κοινό SFT checkpoint, χρησιμοποίησαν τα ίδια fixed MiniOneRec SID assignments, constrained decoding με το ίδιο valid-SID trie και αξιολόγηση 50 beams. Τα δημόσια metrics ήταν HR@5, NDCG@5 και HR@10.

Το DASO βελτίωσε το MiniOneRec-style GRPO σε 11 από 12 metrics και πέτυχε την καλύτερη τιμή σε 9 από 12. Στο Office Products, το HR@5 αυξήθηκε από 0,1420 σε 0,1639 για το 1.5B και από 0,1313 σε 0,1683 για το 3B. Στο Industrial and Scientific αυξήθηκε από 0,1321 σε 0,1421 και από 0,1334 σε 0,1476 αντίστοιχα.

Η μεγαλύτερη μεταβολή εμφανίστηκε στις αρχικά δύσκολες περιπτώσεις. Στο Office Products με το 1.5B, το Hard HR@5 ανέβηκε από 0,0331 σε 0,0624 και το Medium από 0,1224 σε 0,1693. Με το 3B, το Hard ανέβηκε από 0,0252 σε 0,0521 και το Medium από 0,1472 σε 0,2102. Τα buckets ορίστηκαν μία φορά στο frozen SFT checkpoint και χρησιμοποιήθηκαν μόνο για diagnostic evaluation, όχι ως training controller.

Στο proprietary εσωτερικό dataset, το Top-20 recall στο πρώτο SID level αυξήθηκε από 47,21% σε 54,23% έναντι του GRPO baseline και το τελικό level από 4,23% σε 4,67%. Το Top-20 recall στο level 2 ήταν η εξαίρεση: 5,16% με DASO έναντι 5,23% με GRPO. Αυτό υποστηρίζει ισχυρότερη είσοδο στο σωστό branch και καλύτερη τελική ανάκτηση, όχι ομοιόμορφη βελτίωση σε κάθε επίπεδο.

Τι δεν αποδεικνύει το paper για το e-commerce

Το paper μετρά recommendation accuracy και recall. Δεν μετρά revenue, conversion rate, basket size, margin, retention ή customer lifetime value. Επομένως δεν αποδεικνύει ότι η υιοθέτηση του DASO θα αυξήσει τις πωλήσεις ενός ηλεκτρονικού καταστήματος. Κάθε εμπορική επίδραση χρειάζεται ξεχωριστό online experiment με κατάλληλα guardrails.

Η μέθοδος επίσης δεν είναι plugin που εγκαθίσταται σε οποιοδήποτε e-shop. Προϋποθέτει Semantic IDs, fixed catalog mapping, constrained decoding, SFT checkpoint, GRPO υποδομή και σημαντικούς υπολογιστικούς πόρους. Η ομάδα πρέπει πρώτα να συγκρίνει αυτή την πολυπλοκότητα με απλούστερα baselines, τις δυνατότητες των υπαρχουσών πλατφορμών εξατομίκευσης για ηλεκτρονικό εμπόριο και το πραγματικό μέγεθος του καταλόγου.

Υπάρχει ακόμη trade-off στα Easy prompts. Το SFT-only checkpoint παραμένει ισχυρό στις περιπτώσεις που ήδη έφερνε το σωστό item, ενώ ορισμένα bucket-level scores μειώνονται μετά το RL. Μια επιχειρηματική αξιολόγηση πρέπει να κοιτά aggregate απόδοση και μεταβολή ανά segment, κατηγορία, νέο ή επαναλαμβανόμενο χρήστη, head και long-tail προϊόντα.

Η απόφαση για ένα e-shop

Μην ξεκινήσετε από το DASO· ξεκινήστε από το μετρημένο failure mode

Προχωρήστε μόνο αν σταθερά Semantic IDs εκφράζουν πραγματική συγγένεια, τα rollout groups χάνουν συχνά το target branch και το offline gain επιβιώνει σε segment regressions. Μετά απαιτείται μικρό online experiment με revenue guardrails, latency budget και ασφαλές rollback.

Η τεχνική ποιότητα του recommender είναι ένα μόνο μέρος της εμπειρίας. Η δομή κατηγοριών, τα φίλτρα, η διαθεσιμότητα, η ταχύτητα και το mobile UX μπορούν να ακυρώσουν ένα καλό ranking. Το Greek Business Website & eShop Benchmark 2026 and the SEO for eCommerce δείχνουν γιατί η απόδοση και η ευρεσιμότητα πρέπει να εξετάζονται μαζί με την εξατομίκευση.

Πρακτικό pilot για recommendation teams

Το σωστό pilot δεν ξεκινά με πλήρη αντικατάσταση του υπάρχοντος recommender. Ξεκινά με ένα versioned snapshot καταλόγου, κοινό evaluation set και σαφή σύγκριση SFT, vanilla GRPO και DASO. Η δημόσια GRID εργασία υπενθυμίζει ότι μικρές αρχιτεκτονικές και hyperparameter επιλογές μπορούν να επηρεάσουν σημαντικά τα αποτελέσματα, άρα η πειραματική απομόνωση είναι απαραίτητη.

Επτά βήματα για ελεγχόμενο DASO pilot

  1. Step 1Ορίστε το recommendation event

    Καθορίστε user context, χρονικό παράθυρο, target item και κανόνες αποκλεισμού, ώστε το label να σημαίνει το ίδιο σε training και evaluation.

  2. Step 2Ελέγξτε την ιεραρχία των Semantic IDs

    Μετρήστε collisions, αστάθεια mappings και πραγματική σημασιολογική συγγένεια ανά prefix. Αν το πρώτο token δεν ορίζει χρήσιμο branch, το prefix reward δεν έχει σωστό νόημα.

  3. Step 3Κατασκευάστε κοινό SFT baseline

    Χρησιμοποιήστε το ίδιο checkpoint, valid-SID trie, decoding budget και chronological split για όλες τις post-training παραλλαγές.

  4. Step 4Μετρήστε το target-missing πρόβλημα

    Παρακολουθήστε exact-hit, partial-prefix και no-prefix prompts, μαζί με την κατανομή prefix-match depth ανά κατηγορία και segment χρηστών.

  5. Step 5Τρέξτε ελεγχόμενες ablations

    Συγκρίνετε online profiling, prefix reward, guided budget και SFT anchor χωριστά, με ίδιο training budget και επαναλήψεις σε περισσότερα seeds.

  6. Step 6Ελέγξτε regressions και λειτουργικό κόστος

    Μετρήστε head και long-tail items, Easy prompts, latency, GPU χρόνο, catalog refresh και failures κατά την αλλαγή ή κατάργηση προϊόντων.

  7. Step 7Περάστε σε περιορισμένο online test

    Ξεκινήστε με μικρό traffic allocation, guardrails για conversion, margin και diversity, audit logs και προκαθορισμένο rollback στο baseline.

The full-stack AI υποδομή έχει σημασία εδώ: το model objective, ο product catalog, το serving layer, τα analytics και η εμπειρία του χρήστη πρέπει να εκδίδονται και να παρακολουθούνται ως ενιαίο σύστημα. Ένα offline HR@5 gain δεν έχει αξία αν το catalog mapping είναι παλιό, το αποτέλεσμα εμφανίζεται αργά ή η πρόταση αγνοεί διαθεσιμότητα και επιχειρηματικούς περιορισμούς.

Τι κρατάμε για την AI personalization

Το ευρύτερο μάθημα του DASO είναι ότι σε έναν δομημένο χώρο αποφάσεων το «λάθος» δεν είναι πάντα μία ενιαία κατηγορία. Μια πρόβλεψη μπορεί να είναι κοντά ή μακριά από τη σωστή λύση και η δομή του output μπορεί να παρέχει ενδιάμεσο σήμα. Η αξία δεν βρίσκεται σε έναν γενικό difficulty score, αλλά σε μετρήσιμο progress μέσα σε συγκεκριμένη ιεραρχία.

Για marketers και e-commerce owners, αυτό μεταφράζεται σε απαίτηση για καλύτερα θεμέλια: καθαρό catalog taxonomy, σταθερά identifiers, συνεπή analytics και evaluation που χωρίζει τα segments. Η κατασκευή ενός e-shop που μπορεί να αξιοποιήσει advanced personalization ξεκινά από αξιόπιστα product δεδομένα και σωστή εμπειρία αναζήτησης, όχι από ένα training acronym.

Το DASO είναι τεκμηριωμένο παράδειγμα σχεδιασμού training loop γύρω από την πραγματική γεωμετρία του recommendation problem. Δεν είναι ακόμη γενική συνταγή για εμπορική επιτυχία. Η ώριμη εφαρμογή επιβεβαιώνει το failure mode, συγκρίνει απλούστερα baselines, προστατεύει όσα λειτουργούν και συνδέει κάθε online αλλαγή με μετρήσιμη επιχειρηματική επίδραση.

Από το recommendation research σε μετρήσιμο pilot

Σχεδιάστε την AI personalization πάνω σε αξιόπιστα δεδομένα και guardrails

Η TWO DOTS χαρτογραφεί catalog data, baselines, evaluation segments, integrations και online KPIs, ώστε ένα AI recommendation workflow να δοκιμαστεί χωρίς να διακινδυνεύσει την εμπειρία και τις πωλήσεις του e-shop.

Frequently Asked Questions (FAQs)

Τι είναι το generative recommendation;

Είναι προσέγγιση όπου το μοντέλο παράγει απευθείας το αναγνωριστικό του προτεινόμενου item από το context του χρήστη, αντί να βαθμολογεί μόνο μια προκαθορισμένη λίστα υποψηφίων.

Τι είναι ένα Semantic ID;

Είναι μια σύντομη ιεραρχική ακολουθία διακριτών tokens που αναπαριστά ένα item. Σχετικά items επιδιώκεται να μοιράζονται αρχικά τμήματα της ακολουθίας.

Ποιο πρόβλημα λύνει το DASO;

Στοχεύει ομάδες GRPO όπου δεν εμφανίζεται το σωστό item και τα item-level rewards δεν διαφοροποιούν επαρκώς τις αποτυχίες. Χρησιμοποιεί το prefix depth για να κατευθύνει περιορισμένο guidance στο bottleneck.

Πώς αποφασίζει πόση καθοδήγηση χρειάζεται;

Μετρά online το μέσο prefix-match depth της τρέχουσας ομάδας. Όσο πιο μακριά βρίσκονται τα rollouts από τη σωστή SID διαδρομή, τόσο μεγαλώνει το guided budget, μέχρι το προκαθορισμένο όριο.

Γιατί διατηρεί raw rollouts;

Επειδή το GRPO χρειάζεται on-policy αντίθεση. Το DASO αντικαθιστά μόνο τα πιο αδύναμα raw completions και κρατά τα ισχυρότερα, ώστε η ομάδα να μην γίνει πλήρως teacher-forced.

Τι προσφέρει το SFT anchor;

Προσθέτει supervised loss πάνω στη σωστή SID ακολουθία και βοηθά να περιοριστεί το συνολικό drift, ενώ τα guided rollouts εστιάζουν στις target-missing περιπτώσεις.

Αποδεικνύει το paper αύξηση πωλήσεων;

Όχι. Αξιολογεί HR, NDCG και level-wise recall σε συγκεκριμένα datasets. Conversion, revenue και άλλα εμπορικά αποτελέσματα χρειάζονται ξεχωριστό online experiment.

Είναι το DASO κατάλληλο για κάθε e-shop;

Όχι απαραίτητα. Απαιτεί generative recommendation υποδομή, σταθερά Semantic IDs, SFT και GRPO. Έχει νόημα μόνο αν το target-missing failure mode είναι σημαντικό και το όφελος δικαιολογεί το κόστος.

Newsletter

Enter your email address below to subscribe to our newsletter