Новый метод управления мультиагентными LLM-системами повысил конверсию на 32 процентных пункта

Мультиагентные системы на основе больших языковых моделей сталкиваются с фундаментальной проблемой: если у агентов противоположные цели и нет общей функции полезности, диалог может выродиться и завершиться без результата. Исследователи из arXiv предложили способ решения этой задачи.
В новой работе описан Experience Orchestrator — управляющий слой, который направляет совместную траекторию взаимодействия агентов. Система использует три механизма: контекстный бандит для выбора контентных вариантов, ПИД-регулятор для поддержания поведенческой согласованности и POMDP-трекер для вероятностной модели намерений посетителя.
Эксперимент проходил в симулированной среде финансовых услуг, где сайт-агент подводил посетителя к контакту с консультантом, а посетитель оказывал психологически реалистичное сопротивление. В 60 000 симуляций новый метод повысил долю успешных контактов с 46,1% до 78,1% по сравнению с наивным LLM-агентом.
Анализ факторов показал, что выбор вариантов контекстным бандитом объясняет 97% различий в результатах. Это подтверждает: итоговая эффективность определяется в первую очередь политикой управления, а не начальными условиями среды.
Послойный анализ выявил два режима. Для посетителей, изначально не склонных к конверсии, управляющий слой становится решающим — без него система перестаёт быть функциональной. Для тех, кто уже близок к согласию, стандартных эмпатических ответов наивного LLM достаточно.
Все выводы основаны на симуляции LLM-агентов. Авторы подчёркивают, что ПИД-регулятор не калибровался на реальной человеческой непредсказуемости, а проверка на живом трафике является следующим критическим шагом.
Работа значима для проектирования диалоговых систем в финансах и других сферах, где агентам с разными целями необходимо достигать взаимовыгодного результата. Предложенный подход может снизить риск срыва переговоров в автоматизированных сервисах.







