AI агенти в здравеопазването: защо правилната обратна връзка е по-ценна от медийния шум

Ново проучване за клиничните агенти показва, че изкуственият интелект не се подобрява благодарение на по-голям шум около него, а чрез обективна обратна връзка, подходящи критерии за оценка и човешко знание в решаващите моменти.

Съдържание

Статията обяснява как AI агентите стават надеждни само когато разполагат с ясен контекст, точни данни, граници на автономност и човешки надзор, преди да окажат влияние върху клиентите, бюджета или критичните функции.

Категория: дигитален маркетинг

Етикети: Изкуствен интелект в здравеопазването, FHIR, усилващо обучение, изкуствен интелект в бизнеса, цифрова трансформация

Откъс: Ново проучване за клиничните агенти показва, че изкуственият интелект не се подобрява благодарение на по-голям шум около него, а чрез обективна обратна връзка, подходящи критерии за оценка и човешко знание в решаващите моменти.

AI агенти в здравеопазването: защо правилната обратна връзка е по-ценна от медийния шум

Посланието, което стои зад проучването

Практическо четене: AI агентите стават надеждни, когато разполагат с ясен бизнес контекст, контролирани източници на данни, ограничения на автономността и човешки надзор, преди да окажат влияние върху клиентите, бюджета или критичните функции.

Изследването Световна обратна връзка за клинични агенти: диагностициране на RL в FHIR среди Това не е поредното обещание, че ИИ-агентите ще заменят специалистите. Основната тема е много по-практична: кога един модел може да се научи да изпълнява правилно известна процедура, когато средата може обективно да провери дали действието е било правилно. Това е от значение за здравеопазването, но и за всеки бизнес, който иска да внедри изкуствен интелект в процеси с правила, формуляри, системи и отговорност.

Авторите разглеждат проекти в среда FHIR, т.е. в стандарт за обмен на здравни данни. Моделът не е предназначен да поставя диагноза, да преценява медицински даден случай или да поема риск без надзор. Той трябва да изпълнява протоколи: да прочете дадена стойност, да приложи праг, да реши дали се налага действие и, когато е необходимо, да създаде правилно структурирана поръчка или запис.

Този подход е полезен за маркетолози, собственици на електронни магазини и бизнес екипи, тъй като наподобява много ежедневни работни процеси. Едно правило в CRM системата, сигнал за наличност, политика за възстановяване на суми, правило за оценка на потенциални клиенти или списък за проверка на съответствието не изискват творчески подход от страна на оператора. Необходими са надеждно изпълнение, правилно четене на данните, ясен формат на изхода и механизъм, който открива грешката, преди тя да се превърне в оперативен проблем.

Същността на изследването е, че учението чрез подсилване с обратна връзка от света има смисъл само когато каналът за обратна връзка е чист и когато моделът разполага с достатъчно начална способност да генерира нещо, което може да бъде подобрено. Ако бенчмаркът погрешно възнаграждава бездействието или ако правилният отговор изисква кодове, които не могат да бъдат открити чрез проби и грешки, RL не прави чудеса. Той се обучава въз основа на грешен сигнал или на плоскостна структура на възнагражденията.

Какво означава „world feedback“ и защо се различава от класическия RLHF

От AI агент без контекст към контролиран работен процес на агента

Агент без достатъчно контекст

Инструментът генерира предложения с непълни данни, неясни права за достъп и без единен източник на достоверна информация. Резултатът може да изглежда убедителен, но е трудно да бъде проверен, преди да окаже влияние върху клиент, бюджет или процес.

Неясен резултатОперационен риск

Работен процес на агентите с човешки надзор

Потокът определя входните данни, източниците на данни, границите на автономност, точките за преглед и измеримите режими на отказ, така че агентът да подпомага екипа, без да се превръща в скрит риск.

Данни за контекстаПроверка от човек

При класическия RLHF хората оценяват отговорите или предпочитанията, а тези оценки се използват като сигнал за обучение. При „world feedback“ средата е проектирана така, че да може да преценява резултата без човешка намеса във всеки епизод. Един верификатор проверява дали действието отговаря на правилото. В примера от проучването верификаторът може да види дали агентът е получил правилната FHIR информация, дали е приложил правилно праговата стойност и дали POST полезният товар има изискваната структура.

Разликата е значителна от икономическа гледна точка. Усилията на експертите по темата не се изразходват за безкрайна ръчна оценка на епизодите. Тя се насочва към проектирането на средата, правилата и системата за оценяване. За дадена компания това означава, че експертите не трябва да коригират всеки възможен отговор на агента. Те трябва да кодират точно какво се счита за правилно действие, грешно действие, излишно действие и приемлива форма.

Тази логика е пряко свързана с автоматизацията на бизнес процесите. Един сайт за електронна търговия може да разполага с верификатор за връщания, фактуриране, промени в наличностите или създаване на заявки. Един маркетинг екип може да разполага с верификатор за съответствие на UTM параметрите, таксономията на кампаниите или използването на бранд твърдения. Екипът по операциите може да разполага с инструмент за проверка на SLA, правилните полета в ERP системата и приемливата последователност от стъпки. AI агентът не трябва просто да звучи убедително. Той трябва да издържи проверка в реалния свят.

Проучването обаче показва, че този „верификатор“ трябва да бъде строг и справедлив. Ако остави възможност за възнаграждение при грешна стратегия, моделът ще я открие. Ако най-лесната печалба е да не прави нищо, той ще се научи да не прави нищо. Ако всяко действие получава дори и малко признание, той може да се научи да действа прекалено активно. Обратната връзка не е подробност от реализацията. Тя е продуктът, който обучава агента.

Проблемът с тавана със „silent-finish“ в MedAgentBench

Основно решение

Коя задача е достатъчно ясна за AI агент?;

Започнете с работни процеси с ясни входни данни, проверими данни и нисък риск, като отчети, проверки на качеството на данните, мониторинг, първоначални предложения или сортиране на задачи в бек-офиса. Ако решението засяга клиент, бюджет или сигурност, е необходимо одобрение от човек, преди да бъде изпълнено.

Един от най-полезните аспекти на проучването е определянето на първоначалния еталон. В версиите MedAgentBench v1 и v2 имаше висок таван на „silent-finish“: един нулев агент, който приключваше веднага, без да извиква инструменти, можеше да премине 41,71 TP3T от задачите. Това не беше непременно грешка във всяка задача. В много клинични потоци наистина не се изисква действие. Проблемът е, че като цяло бенчмаркът превърна бездействието в много добра стратегия.

За усилващото обучение това е рисковано. Моделът не разбира целта на бенчмарка. Той вижда награда. Ако наградата показва, че бездействието често води до печалба, обучението може да доведе до агент, който избягва действие дори когато трябва да действа. Авторите посочват, че в некоригирания MAB-v2 GRPO е конвергирал към 0% action-branch pass. С прости думи, моделът е научил лесния изход.

Екипът разработи MedAgentBench-v3 с 508 задачи и намали тавана на „silent-finish“ до 8,91 TP3T. Това беше постигнато чрез корекции в контекста, замразяване на проблемни времеви отметки, маркиране на случаите на „silent-finish“ и съотношение 1:1 между инстанциите с действие и без действие. Промяната не е просто техническа. Това е урок за всяка компания, която разработва AI оценка: ако наборът от данни възнаграждава избягването на отговорност, агентът ще изглежда сигурен в обобщените резултати, но ще се провали там, където се изисква действие.

В областта на маркетинга и обслужването на клиенти същият проблем възниква, когато оценките измерват само липсата на грешки, а не правилното действие, когато е необходимо. Един оператор от отдела за поддръжка, който затваря малко заявки, но не допуска грешки, може да изглежда добър. Служител по квалифициране на потенциални клиенти, който не препраща никого, може да има нулеви „фалшиви положителни“. Правилният критерий за сравнение трябва да отчита и двете страни: кога трябва да се действа и кога трябва да се спре.

Скритите изисквания за формата подкопават образованието

Проучването установи също така и недокументирани изисквания за формат. Някои оценители изискваха конкретни формати, които не бяха ясно посочени в контекста на задачата, като полета за маршрут под формата на „bare-string“, формули за дозиране на няколко нива или масиви с два елемента в отговора. Това създава често срещан проблем в работните потоци на изкуствения интелект: моделът може да е разбрал същността на задачата, но да се провали, защото изходът не отговаря на скрита конвенция.

В реалния свят формата не е второстепенна. Едно правилно съобщение, което не минава валидацията на схемата, поръчка с грешно поле, продукт с грешно съответствие на категорията или експорт на кампания с непоследователно наименование може да блокира целия процес. Изследванията показват, че ако форматът е изискване, той трябва да бъде изрично посочен в контекста или да се научи чрез примери с надзор. Не е справедливо да изискваме от RL да открива невидими конвенции.

Имаше и грешка, свързана с „wall-clock“: един градер използваше текущата дата като референтна дата за CT проследяване, което доведе до грешно класифициране на някои инстанции, когато програмата се изпълняваше през 2025–2026 г. Авторите фиксираха времевата отметка на конкретна дата. За бизнеса това напомня, че всяка автоматизация, която зависи от днешния ден, текуща кампания или активна политика, се нуждае от детерминистични тестове. В противен случай един и същ промпт може да мине успешно в понеделник и да се провали в петък.

Практическото заключение е, че не е достатъчно да проверяваме дали агентът е прав. Трябва да преценяваме дали е прав в формата, която системата приема. За CRM, ERP, CMS и рекламни платформи това означава схеми, примери, отрицателни тестове и ясна отговорност за промените, когато правилата се променят.

Как беше проектиран MAB-v3 като среда за обратна връзка

Средата MAB-v3 се основава на стабилен snapshot на HAPI FHIR сървър с около 100 реални анонимизирани пациенти. Всяко изпълнение е детерминистично: едно и също запитване връща един и същ отговор, няма променящо се състояние на сървъра и епизодите приключват бързо. Това е предпоставка за RL, тъй като са необходими хиляди rollouts и моделът трябва да се учи от действията си, а не от шума на инфраструктурата.

Наградата не се състоеше само от „издържал/неиздържал“. Авторите я разделиха на крайна награда, награда за действие и наказания. Имаше пълна награда, когато оценяващият даваше „издържал“, частични точки за правилен тип ресурс и структура на POST, наказание за POST, който не е насочен към целта при задача без действие, и наказание за завършване без използване на инструмент. Тази конфигурация е от решаващо значение, тъй като създава градиент както за действието, така и за условието.

Без частични точки моделът разглежда равен терен, докато не постигне точно правилната поръчка. Без наказание за ненужни действия той може да се научи да действа винаги, защото всяко действие носи някаква полза. Това важи и за търговските системи. Ако давате бонус на агента само защото е отворил заявка, той ще отваря заявки. Ако го наказвате само за грешна заявка и не го възнаграждавате за правилно ескалиране, той ще замръзне. Проектирането на наградите е проектиране на поведение.

Верификаторът на проучването беше базиран на правила и подлежащ на одит, с 1 340 реда спецификации за 20 вида задачи. Всяка грешка можеше да бъде свързана с конкретен критерий. За предприятията това е може би най-полезният модел: когато агентът се провали, екипът не трябва да вижда само един резултат. Тя трябва да види кой критерий не е изпълнен, кое поле липсва, кое правило е нарушено и дали проблемът се дължи на данни, подсказка, извикване на инструмент, схема или действителна липса на знания.

Резултатите: frontier models, Qwen3-8B, SFT и RL

При frontier моделите авторите са забелязали, че много модели са постигнали по-висока успеваемост в no-action branch, отколкото в action branch. Например, в статията се посочва, че GPT-5.5 има 93,31 TP3T в клона „без действие“ спрямо 77,31 TP3T в клона „с действие“, а Gemini – 95,61 TP3T спрямо 76,51 TP3T. GPT-4o се оказа изключение с по-малък „caution bias“. Няма нужда да правим обобщения извън рамките на проучването. Важното е показателят: общите резултати не разкриват дали даден модел е добър, защото знае кога да не действа, или защото знае и как да действа правилно.

При обучените модели базовият Qwen3-8B постигна резултат от 16,61 TP3T pass@1. Резултатът за „any pass“ беше 21,41 TP3T, което означава, че неуспехите не се дължаха предимно на късмет или на извадката. Моделът не разполагаше с достатъчен латентен капацитет, за да реши задачите просто с повече опити. Налице беше и значителна разлика в корпуса: задачите от v2 имаха 28,01 TP3T, докато тези от v1 – едва 4,81 TP3T. Авторите свързват това с естеството на задачите: някои задачи за вземане на решение приличат повече на знания, които моделът може да е видял, докато задачите за търсене и тези с голямо значение на формата изискват прецизна обработка.

SFT, базиран на правила, достигна 34,11 TP3T при „pass@1“, като „any pass“ беше 44,91 TP3T, а „all pass“ – 25,51 TP3T. Това показва, че супервизираните демонстрации са предоставили на модела кодове, формат и примери, които той не е могъл да открие сам. RL с GRPO през първия епох достигна 18,2% pass@1: малко подобрение спрямо базовия модел, но с 15,9 процентни пункта по-ниско от SFT. Този резултат не означава, че RL е безполезен. Той показва, че чистият RL, започващ от малка база и без предварителни познания за кода, има структурни ограничения.

За бизнеса нещата са ясни. Ако един агент трябва да използва точни кодове на продукти, вътрешни стойности за състояние, таксономии, формати на SKU или юридически термини, не трябва да очакваш, че ще ги научи чрез проби и грешки. Предоставете му примери с надзор, възможности за извличане на информация, таблици за търсене или инструменти с ограничения. Използвайте RL или цикли на обратна връзка, за да подобрите вземането на решения в определени условия, а не за да откривате случайно скрити идентификатори.

Класификацията, която предвижда кога RL помага

Най-практичният принос на изследването е класифицирането на задачите в три категории: „решение“, „търсене“ и „форматно знание“. Задачите от типа „решение“ изискват отчитане на стойност и прилагане на праг, като например заместване на калий, когато K < 3,5 mEq/L, или отмяна на ваксина срещу грип. Тук съществува градиент, тъй като правилното решение се променя в зависимост от наблюдаемата стойност. Моделът може да изпробва действие и бездействие, да види наградите и да научи условния модел.

Задачите за търсене изискват точно извличане на стойности: MRN, възраст, най-скорошен лабораторен резултат. Тук RL може да помогне донякъде при избора на инструмент, който да се извика, и при начина на четене на отговора, но демонстрациите обикновено са по-ефективни. Проблемът не е в мисленето, а в надеждното извличане и форматиране. В бизнес среда това са задачи от типа „намери клиентски идентификационен номер“, „последна фактура“, „активен абонамент“, „стойност на запасите“ или „разходи за последната кампания“.

Задачите, свързани с познаване на форматите, са най-трудните за чистото RL. Те изискват точен клиничен код, като SNOMED или NDC, който не може да бъде извлечен чрез проучване. Ако агентът въведе грешен код, той получава отрицателна награда, както би получил за всеки произволен грешен код. Няма постепенен сигнал, който да го насочи към правилния идентификатор. Това е плосък ландшафт на наградите.

Тази класификация може да се превърне в инструмент за изготвяне на пътна карта за изкуствен интелект. Преди да включиш агент в даден процес, запитай се: става ли дума за вземане на решение, търсене или познаване на формат? Ако е вземане на решение, се нуждаеш от ясни прагове и добра обратна връзка. Ако е „търсене“, ви е необходим надежден достъп до данни и анализ на данните. Ако е „форматно знание“, ви е необходимо вграждане на знания, таблици, валидатори и вероятно генериране с ограничения. Един и същ модел не трябва да се справя с всички задачи с една и съща стратегия.

Какво означава това за работните процеси с изкуствен интелект в маркетинга и електронната търговия

Въпреки че статията е с клинична насоченост, нейните принципи са изключително приложими за дигиталните операции. Маркетинг специалистът, който управлява кампании, има задачи, свързани с вземането на решения: да увеличи бюджета, когато CPA падне под целта; да спре рекламния набор, когато честотата се повиши прекалено; да предложи ново рекламно съдържание, когато ангажираността спадне. Има задачи за търсене: да извлече данни за разходите, ROAS, името на аудиторията, състоянието на продуктовия фийд. Има и задачи, свързани с познания за форматите: да използва правилната конвенция за именуване, UTM таксономията, идентификатора на продуктовата категория или твърдения, които отговарят на политиките.

Ако смесиш всичко и изчислиш само един общ резултат, ще пропуснеш истинското място, където възниква затруднение. Възможно е агентът да е добър в вземането на решения, но да се проваля при спазването на конвенциите за именуване. Възможно е да извършва правилно търсене, но да не знае кога трябва да действа. Може да изглежда сигурен, защото не прави промени. Проучването напомня, че са необходими показатели, специфични за всеки клон: действие срещу липса на действие, правилно търсене срещу грешна стойност, валидна схема срещу невалиден полезен товар, безопасен за политиката срещу рискован резултат.

За електронната търговия подобен бенчмарк би могъл да включва задачи като: ако наличността е под прага, създай сигнал за повторна поръчка; ако клиентът има връщане в рамките на политиката, предложи процедура за възстановяване на сумата; ако на продукта липсва GTIN, да се създаде заявка за качество на данните; ако поръчката съдържа подозрителна комбинация, да се поиска ръчна проверка. Всяка задача трябва да има проверяващ, който преценява както решението, така и формата на действието.

Големият капан е да се стартира екип от агента, а не от средата. Статията показва, че средата често е истинският продукт. Ако нямате чисти данни, детерминистични тестове, документирани формати, етикети за грешки и баланс на разклоненията, дори най-добрият модел ще се научи на грешни неща. За предприятията инвестицията не е само в подсказки. Тя е в оценяване, договори за данни и оперативна обратна връзка.

Защо SFT и RL не са съперници

Дискусията около изкуствения интелект често представя методите за обучение като конкурентни. Настоящото проучване показва точно обратното. SFT предоставя на модела това, което RL трудно успява да открие: форма, кодове, примери, правилна последователност от стъпки. RL предоставя това, което SFT трудно успява да мащабира: адаптация към множество случаи чрез обратна връзка от света, особено когато правилата могат да бъдат оценявани автоматично.

Авторите не твърдят, че SFT е окончателното решение. SFT постигна по-добър резултат при pass@1, но пропуските „any/all“ сочат несъгласуваност: някои задачи се решават понякога, но не винаги. RL би могло да се използва след SFT, за да подобри условното разсъждение, т.е. кога трябва да се действа и кога не. Това е същността на предложената посока SFT+RL.

На практика един бизнес екип може да го интерпретира по следния начин. Първо създаваш подбрани примери за критичните формати, кодовете, крайните случаи и инструментите. След това стартираш агенти в тестова среда с верификатор и събираш обратна връзка. След това подобрявате подсказките, извличането на информация, схемите на инструментите или извършвате фина настройка, където е необходимо. Не очаквате от един общ модел да научи вътрешни правила въз основа на неясни забележки.

Тази логика е особено подходяща за компании, които искат да използват изкуствен интелект, без да губят контрол. Експертите запазват контрола върху правилата. Моделът се учи да работи в определени рамки. Обратната връзка подлежи на проверка. А промените в протокола се отразяват като актуализации във верификатора или в примерите, а не като хаотично преобучение на поведението.

Границите на проучването и правилното тълкуване на данните за пазара

Авторите са внимателни по отношение на обхвата. Работата се отнася до задачи, свързани с изпълнението на протоколи, а не до отворено клинично разсъждение, диференциална диагноза или случаи, при които правилността е спорна. Това е важно, защото пазарът често превръща тесните изследователски резултати в общи обещания. Тук правилният извод е по-дисциплиниран: ИИ агентите могат да се учат по-добре, когато задачата има известно правило и проверими резултати.

Има и ограничения в данните. MAB-v3 използва около 100 анонимизирани пациенти, по 30 инстанции за всеки тип задача, а след ограничението 1:1 някои типове имат малко инстанции на действие. Инструкциите за задачите са по-конкретни от реалната клинична документация. Следователно резултатите не трябва да се тълкуват като готовност за внедряване. Те трябва да се разглеждат като диагноза на това, което е необходимо за надеждно обучение и оценяване.

За пазара това е полезен урок. Не е необходимо всяка инициатива в областта на изкуствения интелект да обещава пълна автономност. Някои от най-значимите приложения ще бъдат ограничени, контролирани, подходящи за одит и обвързани с правила. Един агент, който намалява ръчните проверки в добре дефиниран работен процес, може да има по-голяма бизнес стойност от агент, който обещава да мисли, но не може да обясни защо е допуснал грешка.

Проучването предлага също така речник с термини за обсъждане с доставчиците. Попитайте дали измерват „silent-finish ceiling“. Попитайте дали правят разграничение между „action“ и „no-action performance“. Попитайте как се справят със задачите за познаване на форматите. Попитайте дали верификаторите подлежат на одит. Тези въпроси са по-съществени, отколкото просто да поискате демонстрация, която изглежда впечатляващо в три избрани случая.

Практическа рамка за прилагане за групи, които искат агенти

Първата стъпка е да се направи преглед на работните потоци. Не започвайте с въпроса къде да поставите агента. Започнете с това коя процедура има ясни правила, повтарящи се входни данни и измерим правилен резултат. Разделете задачите на „вземане на решение“, „търсене“ и „форматно знание“. Това ще покаже къде се нуждаете от обратна връзка от типа на редуктивния обучение (RL), къде се нуждаете от по-добра връзка между данните и къде се нуждаете от експлицитно въвеждане на знания.

Втората стъпка е проектирането на верификатора. Напишете правилата така, както бихте написали изискванията към продукта за производствена система. Кои входни данни са необходими? Кои изходни данни са приемливи? Кога липсата на реакция е правилна? Кога се счита за неуспех? Коя грешка е грешка във формата и коя е грешка при вземането на решение? Кои грешки трябва да се спират автоматично и кои да се препращат към човек?;

Третата стъпка е балансираната оценка. Ако 90% от историческите случаи не изискват действие, модел, който не прави нищо, ще изглежда добър. Създайте тестови набори, които принуждават агента да докаже и двете: сдържаност и действие. Измервайте поотделно фалшивите действия, пропуснатите действия, невалидния полезен товар, грешното търсене, нарушението на политиката и неподкрепената увереност. Само така ще разберете какво наистина се подобрява.

Четвъртата стъпка е поетапната автономност. Започнете с препоръки само за четене, преминете към чернови на действия, след това към изпълнение под надзор и едва по-късно към ограничено автоматично изпълнение. Статията не подкрепя преминаването към неконтролирани агенти. Тя подкрепя по-добра обратна връзка, по-добри тестови набори и съчетаване на човешкото знание с модели, които се обучават в проверима среда.

Подходът на TWO DOTS към AI агентите

За TWO DOTS интересът от проучването не се състои само в здравето. Той се състои в това как да проектираме отговорни системи за изкуствен интелект за бизнеса. Посланието е, че агентите не стават надеждни само защото им даваме по-приятелски подсказки. Те стават надеждни, когато заобикалящата ги среда е измерима, правилата са ясни, а грешките се връщат като полезна обратна връзка.

Следващият етап на изкуствения интелект в маркетинга, електронната търговия и оперативната дейност ще изисква по-малко впечатляващи презентации и повече механична оценка. Ще трябва да знаем дали агентът се проваля, защото не е намерил данни, защото не е знаел кода, защото се е объркал в условието или защото неговият бенчмарк му е научил погрешно поведение. Тази диагностика е истинското конкурентно предимство.

Проучването показва също, че хората не изчезват от процеса. Те се преместват на по-ключово място: в разработването на правила, верификатори, примери и безопасни граници. Това е много по-реалистично от идеята, че един агент ще разбере сам всеки вътрешен процес. Човешкото знание се превръща в инфраструктура.

Ако трябва да извлечем един практически урок, той е следният: преди да поискаме от един AI агент да предприеме действие, трябва да знаем как ще докажем, че е действал правилно. Без това нямаме автоматизация. Имаме просто модел, който звучи убедително в рамките на система, която не знае как да го контролира.

Таблица с оперативен превод на резултатите

Резултати от проучванетоКакво означава това за едно предприятиеПрактическо действие
Таван „Silent-finish“ 41,7% в старите версииЕдин бенчмарк може да възнагради бездействието и да прикрие пропуснати действияИзчислете отделно action и no-action branches
MAB-v3 с 508 задачи и 8,91 TP3T при „silent-finish“ таванЯсната обратна връзка изисква ясен дизайн на оценяванетоБалансирайте тестовите набори и премахнете „кратките пътища“ към наградите
SFT 34,1% pass@1 спрямо RL 18,2%Наблюдаваното знание помага, когато са необходими точни формати и кодовеПредоставете примери, схеми и таблици за справка преди циклите на RL
Решение / търсене / таксономия на знанията за форматитеНе всички задачи се усвояват по един и същ начинНачертайте всеки работен процес, преди да изберете техника
Проверяем верификатор с 1 340 редаРезултатът трябва да обяснява критерия за неуспехЗаписвайте логовете по правило, поле и извикване на инструмент

Контролен списък преди включването на агент в производствения процес

Започнете с дефинирането на допустимите действия. Всяко извикване на инструмент трябва да има ясна цел, схема, задължителни полета и правило за успех. Ако дадено поле е задължително за система, разположена по-надолу по веригата, не го оставяйте в естествен език. Направете го типизирано, валидирано и така, че да може лесно да бъде отхвърлено на ранен етап.

Разграничете успеха по съдържание и успеха по форма. Един агент може да вземе правилно оперативно решение, но да изпрати полезен товар, който бива отхвърлен. Може също така да изпрати валиден полезен товар при неправилни условия. Тези режими на отказ изискват различно третиране, затова трябва да се регистрират отделно.

Създавайте тестове с отрицателен резултат. Не тествайте само лесни случаи, в които трябва да се предприеме действие. Тествайте случаи, в които агентът трябва да откаже, да поиска одобрение от човек, да изчака по-добри данни или да върне структурирана несигурност. Сигурността не е пасивност; тя е правилният избор на клон.

Не оставяйте вътрешните кодове да останат загадка за модела. Ако процесът изисква идентификатори на кампании, статуси в ERP системата, диагностични кодове, изброени типове продукти или юридически одобрени фрази, предоставете ги чрез извличане, ограничени опции или примери. RL може да подобри поведението по отношение на тях, но не и да ги отгатне надеждно.

Измервайте напредъка по начин, който води до вземане на решение. Общата оценка е полезна за таблото с показатели, но не ви казва какво да направите утре. Един добър доклад за оценка трябва да показва: кои задачи са „мъртви зони“, кои имат голяма вариация, кои имат грешки във форматирането, кои имат пропуснати действия и кои се нуждаят от нов проверяващ.

Стъпки за надежден работен процес с AI агент

Стъпки за надежден работен процес с AI агент

  1. Стъпка 1Определете задачата и допустимите данни.

    Опишете какви входни данни получава агентът, кои източници се считат за надеждни и кои данни не е позволено да се използват.

  2. Стъпка 2Определете граници на автономност и точки за преглед.

    Разграничете какво може да предложи, какво може да изпълни и кога трябва да спре, за да получи одобрение от човек.

  3. Стъпка 3Измерете точността, времето и начините на отказ.

    Сравнете резултата с човешкия еталон и отбележете кога агентът се проваля, забавя се или се нуждае от повече данни.

Подробни указания за прилагане, предназначени за оперативни екипи

За екип, който разработва агент, практическото тълкуване на това откритие е, че всяка автоматизация трябва да има свой собствен малък бенчмарк, преди да премине в производствена среда. Бенчмаркът не трябва да включва само идеални случаи. Той трябва да включва примери за правилни бездействия, примери за грешни бездействия, правилни действия в сложна форма и погрешни действия, които изглеждат убедителни в естествения език.

Проучването помага също така да се избегне прекомерното доверие в общите проценти. Един агент може да има приличен общ резултат, защото лесно печели случаите без действие (no-action cases), докато губи случаите с действие (action cases), които имат реална оперативна стойност. Затова е необходимо отчитане по клонове и по таксономия на задачите, за да може екипът да знае дали трябва да подобри данните, формата, логиката на вземане на решения или вливането на знания.

В маркетинговия контекст това означава строго разграничение между предложението и изпълнението. Агентът може първо да предложи промени в бюджета, целевата аудитория или рекламния текст, а проверяващият да провери дали предложението съответства на целите и ограниченията. Едва когато начините за възникване на грешки са ясни, има смисъл да се разрешат ограничени автоматични промени.

В средата на електронната търговия това означава агентите да се тестват в реални, но анонимизирани ситуации: връщания, наличности, промени в цените, грешки във фийда, липсващи атрибути и ескалации към поддръжката. Правилата трябва да бъдат написани по начин, който позволява машинно проверяване и човешка проверка, когато нещо се обърка.

За екип, който разработва агент, практическото тълкуване на това откритие е, че всяка автоматизация трябва да има свой собствен малък бенчмарк, преди да премине в производствена среда. Бенчмаркът не трябва да включва само идеални случаи. Той трябва да включва примери за правилни бездействия, примери за грешни бездействия, правилни действия в сложна форма и погрешни действия, които изглеждат убедителни в естествения език.

Проучването помага също така да се избегне прекомерното доверие в общите проценти. Един агент може да има приличен общ резултат, защото лесно печели случаите без действие (no-action cases), докато губи случаите с действие (action cases), които имат реална оперативна стойност. Затова е необходимо отчитане по клонове и по таксономия на задачите, за да може екипът да знае дали трябва да подобри данните, формата, логиката на вземане на решения или вливането на знания.

В маркетинговия контекст това означава строго разграничение между предложението и изпълнението. Агентът може първо да предложи промени в бюджета, целевата аудитория или рекламния текст, а проверяващият да провери дали предложението съответства на целите и ограниченията. Едва когато начините за възникване на грешки са ясни, има смисъл да се разрешат ограничени автоматични промени.

В средата на електронната търговия това означава агентите да се тестват в реални, но анонимизирани ситуации: връщания, наличности, промени в цените, грешки във фийда, липсващи атрибути и ескалации към поддръжката. Правилата трябва да бъдат написани по начин, който позволява машинно проверяване и човешка проверка, когато нещо се обърка.

За екип, който разработва агент, практическото тълкуване на това откритие е, че всяка автоматизация трябва да има свой собствен малък бенчмарк, преди да премине в производствена среда. Бенчмаркът не трябва да включва само идеални случаи. Той трябва да включва примери за правилни бездействия, примери за грешни бездействия, правилни действия в сложна форма и погрешни действия, които изглеждат убедителни в естествения език.

Проучването помага също така да се избегне прекомерното доверие в общите проценти. Един агент може да има приличен общ резултат, защото лесно печели случаите без действие (no-action cases), докато губи случаите с действие (action cases), които имат реална оперативна стойност. Затова е необходимо отчитане по клонове и по таксономия на задачите, за да може екипът да знае дали трябва да подобри данните, формата, логиката на вземане на решения или вливането на знания.

В маркетинговия контекст това означава строго разграничение между предложението и изпълнението. Агентът може първо да предложи промени в бюджета, целевата аудитория или рекламния текст, а проверяващият да провери дали предложението съответства на целите и ограниченията. Едва когато начините за възникване на грешки са ясни, има смисъл да се разрешат ограничени автоматични промени.

Какво повишава доверието в AI агентите

Примерна йерархия на приоритетите за сигурни работни потоци на агентите в областта на маркетинга, електронната търговия и бек-офиса.

Чист бизнес контекст
92
Проверяеми източници на данни
88
Преглед с участието на човек
84
Граници на автономността и разрешения
80
Измерими начини на отказ
76

Искате ли AI агенти с контрол и ясен процес?;

AI работни потоци и Digital Back Office от TWO DOTS

Проектираме контролирани автоматизирани процеси, работни потоци на агенти и бек-офис потоци с чисти източници на данни, човешки надзор и измерими контролни точки, преди да бъдат засегнати клиенти, бюджет или критични функции.

Често задавани въпроси

Какво представлява „world feedback“ при AI агентите?;

Това е обратна връзка, която произтича от самата среда или от верификатор, а не от човешка оценка на всеки отговор. Верификаторът проверява дали действието отговаря на правилата и връща сигнал за обучение.

Защо FHIR е важен за проучването?;

FHIR е стандарт за обмен на медицински данни. Той позволява на бенчмарка да тества агенти, които използват инструменти в структурирана клинична среда, като например извличане на лабораторни резултати и създаване на правилни заявки.

Какво представляваше таванът с „silent-finish“?;

Това беше процентът от задачите, които един агент можеше да премине, като ги завърши незабавно, без да извършва никакви действия. В по-старите версии той беше 41,71 TP3T, което правеше инертността привлекателна стратегия за RL.

Защо SFT се представи по-добре от чистото RL?;

SFT предостави примери, формат и кодове, които чистият RL не можа лесно да открие. RL отбеляза леко подобрение, но се сблъска с тавана на възможностите и бариерите, свързани с познаването на формата.

Кога RL помага най-много?;

Помага най-много при задачи, свързани с вземане на решения, при които има наблюдаема ситуация и ясна разлика в наградата между правилно и грешно действие. Не е идеален за сляпо откриване на точни кодове.

Какво означава това за агентите в електронната търговия?;

Това означава, че трябва да разграничаваме задачите за вземане на решения, задачите за търсене и задачите, свързани с познания за форматите. За всеки тип са необходими различни инструменти за оценяване, примери и верификатори.

Могат ли агентите да работят без човешки надзор?;

Изследването не подкрепя безконтролната автономност. То показва, че агентите се нуждаят от ясни условия, верификатор, примери и поетапна автономност, преди да предприемат критични действия.

Кой е основният урок в бизнеса?;

Преди да поискаме от даден агент да изпълни работния поток, трябва да знаем как ще проверим дали той е изпълнен. Проектирането на обратната връзка е също толкова важно, колкото и самият модел.

Информационен бюлетин

Въведете имейл адреса си по-долу, за да се абонирате за нашия бюлетин