AI skills: γιατί ο τρόπος παρουσίασης αλλάζει τη σωστή επιλογή εργαλείου

Η μελέτη Tinycloud δείχνει ότι το AI skill routing αλλάζει με την έκθεση των skills. Τι μετράμε πριν ένα agentic workflow περάσει στην παραγωγή.

Το AI skill routing δεν εξαρτάται μόνο από το τι μπορεί να κάνει κάθε εργαλείο, αλλά και από το πόσο καθαρά και ισότιμα παρουσιάζεται στον planner. Στο Tinycloud, η πλήρης έκθεση όλων των skills επέλεξε το σωστό skill και στα έξι fixture tasks, ενώ η μικτή παραγωγική διάταξη αστόχησε σε ένα και η listing-only διάταξη σε δύο. Το κρίσιμο εύρημα δεν είναι ότι «περισσότερο context είναι πάντα καλύτερο», αλλά ότι η άνιση έκθεση μπορεί να δημιουργήσει lexical competition.

Η μελέτη του Kevin Dela Rosa είναι case study σε ένα συγκεκριμένο multimodal video harness, 13 skills και μία εκτέλεση ανά task και συνθήκη. Για τις επιχειρήσεις προσφέρει έναν πρακτικό φακό: οι περιγραφές, η θέση, το βάθος έκθεσης και το αναμενόμενο deliverable πρέπει να δοκιμάζονται ως ενιαίο σύστημα ανάκτησης δυνατοτήτων.

Съдържание

Κάθε agent harness είναι και μια μικρή μηχανή αναζήτησης

Σε μια βιβλιοθήκη skills, ο agent πρέπει να αναγνωρίσει την πρόθεση του χρήστη, να συγκρίνει υποψήφιες δυνατότητες και να επιλέξει εκείνη που αντιστοιχεί στο ζητούμενο αποτέλεσμα. Σε πολύ μεγάλη κλίμακα, αυτό μπορεί να γίνεται με embeddings και εκπαιδευμένους retrievers. Στο Tinycloud, όπου τα skills χωρούν στο prompt, η επιλογή γίνεται in-context: ο planner «βλέπει» τις αναπαραστάσεις που έχουν τοποθετηθεί μπροστά του και αποφασίζει με βάση αυτές.

Η διάκριση είναι σημαντική για ομάδες που περνούν AI agents στην παραγωγή. Ένα πρόβλημα routing δεν σημαίνει απαραίτητα ότι το μοντέλο αγνοεί το κατάλληλο εργαλείο ή ότι το εργαλείο είναι κακοσχεδιασμένο. Μπορεί να σημαίνει ότι ένα άλλο skill απέκτησε μεγαλύτερη προσοχή επειδή η περιγραφή του ήταν πληρέστερη, πιο κοντά λεκτικά στο αίτημα ή μόνιμα φορτωμένη στο prompt.

Tool-skills και workflow-skills εξυπηρετούν διαφορετικό ρόλο

Η μελέτη διακρίνει δύο επαναλαμβανόμενες κατηγορίες. Τα tool-skills τυλίγουν ένα εξωτερικό API ή ένα system tool και λειτουργούν ως ατομικό λεξιλόγιο: μεταγραφή, semantic search, διαχείριση αρχείων, εξαγωγή δομημένων δεδομένων ή επεξεργασία media. Τα agentic workflow-skills συντονίζουν πολλά tool-skills, ένα βήμα συλλογισμού και ένα template ώστε να παραδώσουν ένα ονομασμένο αποτέλεσμα, όπως ανάλυση συνάντησης, sales-coaching report, blog post ή πακέτο δημοσίευσης YouTube.

Στο συγκεκριμένο harness, τα tool-skills είναι autoloaded και εμφανίζονται με πλήρες σώμα οδηγιών. Τα workflow-skills είναι on-demand: στο αρχικό prompt εμφανίζονται μόνο με όνομα και σύντομη περιγραφή, ενώ το πλήρες σώμα τους φορτώνεται όταν κληθούν. Η επιλογή περιορίζει το context που καταναλώνουν οι μακρές, εξειδικευμένες ροές. Ταυτόχρονα, όμως, δημιουργεί ανισορροπία αναπαράστασης ανάμεσα σε υποψήφιες δυνατότητες.

Tool-skill

Παρέχει μία ατομική δυνατότητα, όπως αναζήτηση, μεταγραφή ή εξαγωγή, και λειτουργεί ως επαναχρησιμοποιήσιμο λεξιλόγιο του agent.

PrimitiveΧωρίς τελικό artifact

Workflow-skill

Συντονίζει εργαλεία, συλλογισμό και template για να παραδώσει ένα ονομασμένο αποτέλεσμα, όπως report ή publishing package.

РецептаΣυγκεκριμένο deliverable

Routing contract

Ορίζει πότε υπερισχύει το εξειδικευμένο workflow και πότε αρκεί το γενικό εργαλείο, ώστε κοινές λέξεις να μη στέλνουν τον planner σε λάθος διαδρομή.

Gold skillΕλέγξιμη επιλογή

Τα templates λειτουργούν ως δομικό αποτύπωμα

Η εργασία εντοπίζει ένα πρακτικό σήμα ταξινόμησης: τον αριθμό και τον ρόλο των templates. Και τα πέντε workflow-skills του καταλόγου έχουν από ένα template που ορίζει το σχήμα του τελικού παραδοτέου, μαζί με δύο scripts για orchestration και rendering. Αντίθετα, τα περισσότερα tool-skills δεν έχουν template, επειδή παρέχουν λειτουργίες και όχι ολοκληρωμένο deliverable.

Υπάρχει μία ειδική εξαίρεση. Το media-artifact είναι tool-skill αλλά περιέχει επτά templates, τα οποία λειτουργούν ως βιβλιοθήκη primitives για άλλες ροές. Άρα το directory templates δεν αρκεί ως μοναδικός κανόνας. Χρειάζεται να εξετάζεται αν το template εκφράζει ένα τελικό προϊόν για τον χρήστη ή μια επαναχρησιμοποιήσιμη μονάδα που καταναλώνουν άλλα skills.

Τρεις τρόποι έκθεσης και ένα μη γραμμικό αποτέλεσμα

Οι ερευνητές συνέκριναν τρεις συνθήκες. Στην All-on όλα τα skills φορτώνονται πλήρως. Στη Default χρησιμοποιείται η παραγωγική διάταξη, με πλήρη έκθεση των tool-skills και σύντομη λίστα για τα workflow-skills. Στην All-off όλα εμφανίζονται μόνο ως ονόματα και περιγραφές, με τις πλήρεις οδηγίες να φορτώνονται κατόπιν αιτήματος.

Στα έξι tasks, η All-on συνθήκη επέλεξε το σωστό skill και στις έξι περιπτώσεις. Η Default πέτυχε πέντε στις έξι, ενώ η All-off τέσσερις στις έξι. Οι μέσοι χρόνοι ήταν 200 δευτερόλεπτα για All-on, 201 για Default και 357 για All-off. Οι μέσες κλήσεις εργαλείων ήταν αντίστοιχα 10,7, 10,2 και 25. Τα νούμερα προέρχονται από μία μόνο εκτέλεση ανά task και συνθήκη, επομένως πρέπει να διαβαστούν ως παρατήρηση της συγκεκριμένης εγκατάστασης, όχι ως σταθερές επιδόσεις για κάθε agent.

Η έκθεση των skills άλλαξε routing, χρόνο και κλήσεις

Οι τιμές προέρχονται από έξι fixture tasks και μία εκτέλεση ανά συνδυασμό· δεν αποτελούν benchmark γενικής απόδοσης.

6/6σωστές επιλογές skill στην All-on συνθήκη
5/6σωστές επιλογές στη Default, με αστοχία στο ad-analysis
4/6σωστές επιλογές στην All-off, με δύο hard failures
357 sμέσος χρόνος All-off, έναντι 200–201 s στις άλλες δύο συνθήκες

Το λάθος στο ad-analysis αποκαλύπτει lexical competition

Το πιο διαφωτιστικό task ζητούσε ανάλυση μιας διαφήμισης βίντεο ως προς hook, pacing και call to action. Η σωστή επιλογή ήταν το workflow-skill ad-analysis. Στην All-on και στην All-off συνθήκη ο agent το επέλεξε σωστά. Στη Default, όμως, κατευθύνθηκε στο autoloaded video-analyze και δεν παρήγαγε το προβλεπόμενο deliverable.

Η ερμηνεία των συγγραφέων είναι ότι η πλήρης, φορτωμένη περιγραφή του video-analyze δημιούργησε ισχυρότερο λεκτικό σήμα από τη μονόγραμμη παρουσίαση του ad-analysis. Η λέξη «analyze» στο αίτημα ταίριαζε άμεσα με το tool-skill και τράβηξε την προσοχή του planner. Η μερική έκθεση αποδείχθηκε χειρότερη από τα δύο άκρα: όταν όλα ήταν πλήρη υπήρχε αρκετό περιεχόμενο για σωστή διάκριση, ενώ όταν όλα ήταν σύντομα ο ανταγωνισμός ήταν πιο ισότιμος.

Μια δοκιμή μετονομασίας του video-analyze σε video-describe δεν διόρθωσε το routing. Η περιγραφή του εξακολουθούσε να περιλαμβάνει τη γλώσσα της ανάλυσης και ο agent το επέλεξε ξανά. Αυτό υποδηλώνει, μέσα στα όρια του πειράματος, ότι δεν αρκεί να αλλάξει το όνομα. Πρέπει να ελεγχθεί ολόκληρη η αναπαράσταση που βλέπει ο planner.

Το All-off εξοικονομεί context αλλά αυξάνει την αβεβαιότητα εκτέλεσης

Η λιτή παρουσίαση όλων των skills είχε το μικρότερο prompt: 6.836 tokens συνολικά, έναντι 7.790 στη Default και 8.168 στην All-on. Το καθαρό Skills block ήταν 457, 1.411 και 1.789 tokens αντίστοιχα. Οι στατικοί κανόνες και τα εργαλεία κατανάλωναν 6.379 tokens σε κάθε συνθήκη, άρα κυριαρχούσαν στο συνολικό budget. Η φόρτωση όλων των workflow-skills πρόσθεσε περίπου 378 tokens σε σχέση με τη Default σε αυτή τη συγκεκριμένη υλοποίηση.

Η εξοικονόμηση του All-off συνοδεύτηκε από αναζήτηση στο filesystem και περισσότερες κλήσεις. Σε ένα task ο agent δεν παρήγαγε deliverable και ζήτησε από τον χρήστη να φορτώσει χειροκίνητα το sales-coaching skill. Σε άλλο, παρέκαμψε το collection-search, κατέφυγε σε υπο-agent πάνω σε cached JSON και χρειάστηκε 17 λεπτά και 83 tool calls. Τα υπόλοιπα επιτυχημένα All-off cells πλήρωσαν premium χρόνου 35% έως 170%.

Η ταχύτητα δεν είναι το μόνο KPI του routing

Για μια επιχείρηση που εφαρμόζει behavioral testing σε AI agents, η σωστή επιλογή skill επηρεάζει περισσότερα από τον χρόνο απόκρισης. Επηρεάζει αν θα παραχθεί το σωστό format, αν θα ακολουθηθούν οι απαιτούμενοι έλεγχοι, αν θα χρησιμοποιηθεί το κατάλληλο template και αν η διαδικασία θα παραμείνει ιχνηλάσιμη. Ένα γενικό εργαλείο μπορεί να δημιουργήσει φαινομενικά χρήσιμο αποτέλεσμα, αλλά να παρακάμψει τη ροή που ενσωματώνει εταιρικούς κανόνες, taxonomy, approvals ή δομή παραδοτέου.

Στα AI workflows για marketing, για παράδειγμα, η απλή ανάλυση ενός βίντεο δεν είναι ισοδύναμη με ένα ad-analysis workflow που απαιτεί συγκεκριμένα πεδία για hook, ρυθμό και CTA. Στο agentic e-commerce, ένα γενικό εργαλείο εξαγωγής κειμένου δεν ισοδυναμεί με μια ροή product-content που εφαρμόζει εμπορική κατηγοριοποίηση και έλεγχο claims. Αυτά είναι επιχειρησιακές αναλογίες της μελέτης, όχι αποτελέσματα που δοκιμάστηκαν στο paper.

Πώς να σχεδιάζονται οι περιγραφές χωρίς αθέλητο ανταγωνισμό

Η πρακτική συνέπεια είναι ότι οι περιγραφές των skills πρέπει να αξιολογούνται ως ένα ενιαίο σύστημα. Δεν αρκεί κάθε περιγραφή να φαίνεται σωστή μεμονωμένα. Χρειάζεται σύγκριση μεταξύ skills που μοιράζονται λέξεις, αντικείμενα ή ενέργειες. Ιδιαίτερη προσοχή απαιτείται όταν ένα γενικό autoloaded tool και ένα εξειδικευμένο on-demand workflow μπορούν να ενεργοποιηθούν από παρόμοια γλώσσα.

Μια ομάδα μπορεί να δημιουργήσει ένα μικρό σύνολο αντιπροσωπευτικών prompts, να ορίσει για καθένα το gold skill και να καταγράφει επιλογή, επιτυχία παραδοτέου, χρόνο και αριθμό κλήσεων. Οι δοκιμές πρέπει να περιλαμβάνουν παραφράσεις και πραγματική γλώσσα χρηστών, κάτι που η ίδια η μελέτη αναγνωρίζει ως μελλοντική επέκταση. Επίσης, αξίζει να εξετάζεται το πλήρες σώμα οδηγιών, όχι μόνο τα ονόματα και τα short descriptions.

Ένας χρήσιμος κανόνας για νέα skills

Το paper προτείνει ένα απλό ερώτημα: παράγει το skill ένα ενιαίο artifact που ο χρήστης μπορεί να ονομάσει; Αν ναι, ταιριάζει περισσότερο στη λογική workflow-skill, με deliverable template και on-demand φόρτωση. Αν όχι, και εκτελεί αναζήτηση, εξαγωγή ή μετατροπή, ταιριάζει στη λογική tool-skill, διαθέσιμο ως βασικό λεξιλόγιο.

Ο κανόνας δεν είναι μαθηματικός νόμος. Αποτυπώνει τη δομή ενός harness. Μπορεί όμως να βοηθήσει ομάδες να αποφύγουν έναν κατάλογο όπου όλα ονομάζονται «εργαλεία» χωρίς σαφή διάκριση ανάμεσα σε primitives και επιχειρησιακές ροές. Η σαφής κατηγορία διευκολύνει την τεκμηρίωση, το testing, την ιδιοκτησία και την παρακολούθηση αποτυχιών.

Κριτήριο παραγωγής

Μην επιλέγετε πολιτική έκθεσης μόνο από το token count

Μετρήστε αν ο agent επιλέγει το gold skill, παράγει το σωστό artifact και τηρεί approvals, taxonomy και audit requirements. Το οικονομικότερο prompt δεν είναι οικονομικό αν πυροδοτεί λάθος workflow ή πολλαπλές άσκοπες κλήσεις.

Έλεγχος AI skill routing σε 7 βήματα

  1. Стъпка 1Χαρτογραφήστε τις επιχειρησιακές προθέσεις

    Ξεκινήστε από πραγματικά αιτήματα χρηστών και αντιστοιχίστε κάθε πρόθεση στο skill που πρέπει να κερδίζει.

  2. Стъпка 2Ορίστε το gold skill και το gold deliverable

    Καταγράψτε τόσο τη σωστή κλήση όσο και το αναμενόμενο format, επειδή ένα πειστικό αλλά λάθος artifact παραμένει αποτυχία.

  3. Стъпка 3Εντοπίστε λεκτικές επικαλύψεις

    Συγκρίνετε ονόματα, σύντομες περιγραφές και πλήρη bodies για κοινά ρήματα, αντικείμενα και όρους που μπορούν να τραβήξουν τον planner.

  4. Стъпка 4Δοκιμάστε ισότιμες συνθήκες έκθεσης

    Τρέξτε all-on, progressive disclosure και listing-only παραλλαγές με το ίδιο μοντέλο, τα ίδια αρχεία και σταθερά εργαλεία.

  5. Стъпка 5Προσθέστε παραφράσεις και δύσκολα negatives

    Χρησιμοποιήστε φυσική γλώσσα πελατών, αμφίσημα prompts και αιτήματα που πρέπει να απορριφθούν ή να δρομολογηθούν σε γειτονικό skill.

  6. Стъпка 6Μετρήστε ολόκληρη την τροχιά

    Παρακολουθήστε επιλογή, τελικό artifact, χρόνο, tool calls, retries, human overrides και τους λόγους κάθε αστοχίας.

  7. Стъпка 7Κυκλοφορήστε με παρατηρησιμότητα και rollback

    Version-control τις περιγραφές, κρατήστε traces ανά έκδοση και ενεργοποιήστε αλλαγές σταδιακά ώστε ένα routing regression να αναστρέφεται άμεσα.

Τι πρέπει να μείνει υπό ανθρώπινη κρίση

Οι συγγραφείς τονίζουν ότι τα αποτελέσματα προέρχονται από ένα harness, έξι fixtures και μία εκτέλεση ανά cell. Το διάστημα αβεβαιότητας για την ακρίβεια κάθε συνθήκης είναι μεγάλο και η διαφορά Default–All-on δεν είναι από μόνη της στατιστικά σημαντική. Το q3 προσφέρει ποιοτικό μηχανισμό και χρήσιμη υπόθεση προς δοκιμή, όχι απόδειξη ότι η πλήρης φόρτωση είναι πάντοτε η καλύτερη πολιτική.

Καθώς οι βιβλιοθήκες μεγαλώνουν σε εκατοντάδες ή χιλιάδες skills, η πλήρης έκθεση παύει να είναι πρακτική και απαιτείται learned retrieval. Η μελέτη θέτει τρία ανοιχτά ερωτήματα: αν το lexical competition επιμένει σε μεγαλύτερη κλίμακα, αν εμφανίζεται με πραγματικά production prompts και αν μια δυναμική πολιτική autoload ανά αίτημα μπορεί να συνδυάσει σωστό routing με μικρό context cost.

Από το prompt engineering στη μηχανική ανάκτησης δυνατοτήτων

Για τους υπεύθυνους AI προϊόντων, το βασικό μάθημα είναι ότι η βιβλιοθήκη skills χρειάζεται διαχείριση όπως ένα σύστημα πληροφορίας. Θέλει ταξινομία, σαφείς συμβάσεις, ελεγχόμενες αναπαραστάσεις, μετρήσιμα fixtures, audit trail και παρακολούθηση λαθών. Το routing δεν πρέπει να αντιμετωπίζεται ως αόρατη λεπτομέρεια του μοντέλου, αλλά ως σχεδιαστική επιφάνεια του agent harness.

Η πιο ασφαλής πορεία δεν είναι να φορτώνονται μηχανικά όλα ή να κρύβονται όλα. Είναι να μετράται πώς η συγκεκριμένη διάταξη επηρεάζει τις πραγματικές εργασίες και τα όρια ανάθεσης στην AI της επιχείρησης. Αν ένα εξειδικευμένο workflow χάνει συστηματικά από ένα γενικό εργαλείο, η λύση μπορεί να βρίσκεται στην ισορροπία έκθεσης, στο σώμα των οδηγιών, στη διακριτότητα του deliverable ή σε έναν ξεχωριστό router, όπως συμβαίνει και στην προσαρμοστική ανάκτηση για AI search agents. Η αναπαράσταση δεν είναι απλή τεκμηρίωση· συμμετέχει στην απόφαση.

AI workflows με ελεγχόμενο routing

Δώστε στον agent σαφή διαδρομή πριν του δώσετε περισσότερα εργαλεία

Η TWO DOTS σχεδιάζει AI αυτοματισμούς επιχειρήσεων με συγκεκριμένα routing contracts, δοκιμές πραγματικών prompts, παρατηρησιμότητα, approval gates και ασφαλές rollback, ώστε κάθε workflow να καλεί τη σωστή δυνατότητα και να παραδίδει το σωστό artifact.

Често задавани въпроси

Τι είναι ένα AI skill;

Στο πλαίσιο της μελέτης, είναι ένα πακέτο οδηγιών και προαιρετικών scripts ή templates που δίνει στον agent μία συγκεκριμένη δυνατότητα ή ροή εργασίας.

Ποια είναι η διαφορά tool-skill και workflow-skill;

Το tool-skill παρέχει μία ατομική λειτουργία. Το workflow-skill συνδυάζει λειτουργίες, συλλογισμό και template ώστε να παράγει ένα συγκεκριμένο παραδοτέο.

Τι σημαίνει autoload;

Σημαίνει ότι το πλήρες skill εμφανίζεται στο system prompt από την αρχή, αντί να παρουσιάζεται μόνο με όνομα και σύντομη περιγραφή και να φορτώνεται όταν χρειαστεί.

Γιατί η μερική έκθεση μπορεί να αποτύχει;

Ένα πλήρως φορτωμένο γενικό skill μπορεί να έχει ισχυρότερο λεκτικό σήμα από ένα καταλληλότερο workflow που εμφανίζεται μόνο σε μία γραμμή, οδηγώντας τον planner σε λάθος επιλογή.

Η All-on συνθήκη είναι πάντα καλύτερη;

Όχι. Ήταν καλύτερη στα έξι συγκεκριμένα tasks, αλλά η μελέτη είναι μικρή και η πλήρης φόρτωση δεν κλιμακώνεται σε πολύ μεγάλες βιβλιοθήκες skills.

Αρκεί να μετονομάσουμε ένα skill;

Όχι απαραίτητα. Στο πείραμα η μετονομασία δεν διόρθωσε το λάθος, επειδή το σχετικό λεκτικό σήμα παρέμενε στο πλήρες σώμα της περιγραφής.

Ποια metrics αξίζει να παρακολουθεί μια ομάδα;

Την επιλογή του gold skill, την παραγωγή του σωστού deliverable, τον χρόνο, τις κλήσεις εργαλείων, τα retries, τις ανθρώπινες παρεμβάσεις και τους τύπους αποτυχίας.

Ποιο είναι το βασικό όριο της μελέτης;

Αξιολογεί ένα harness, 13 skills στην ablation, έξι tasks και μία εκτέλεση ανά συνδυασμό, χωρίς paraphrase ή seed sweep, άρα λειτουργεί ως case study και όχι ως γενικό benchmark.

Информационен бюлетин

Въведете имейл адреса си по-долу, за да се абонирате за нашия бюлетин