Новый метод FABLE адаптирует LLM-агентов под пользователя без дообучения
Адаптация больших языковых моделей под индивидуальные предпочтения пользователя — одна из ключевых задач при создании ИИ-агентов. Они умеют работать с памятью, вызывать инструменты, задавать уточняющие вопросы и менять стиль ответов, но как эти решения адаптировать под конкретного человека, остаётся сложной проблемой.
Традиционные подходы предполагают дообучение отдельной модели, что дорого или невозможно для проприетарных систем. Промпты и память лишь передают пользовательскую информацию агенту, но не меняют его поведение на основе обратной связи. В новой научной работе предлагается рассматривать персонализацию «замороженного» агента как онлайн-обучение индивидуальной политики выполнения действий на основе скалярного сигнала, полученного только для выполненного действия.
Исследователи представили FABLE (Factorized Adaptive Bandit Layer for Execution) — лёгкий слой политики, размещаемый снаружи агента, который может быть полностью чёрным ящиком. FABLE разделяет решения по памяти, получению информации и формированию ответа, чтобы обновления от обратной связи влияли на связанные компоненты. Перед исследованием действия фильтруются через задаваемый извне допустимый набор, а предпочтения пользователя моделируются как остаточные отклонения от фиксированной базовой оценки с помощью байесовского контекстуального бандпита Томпсона.
В теоретической части работы показано, что калиброванный вариант FABLE обладает ограничением ожидаемого сожаления по сравнению с лучшим допустимым действием. Также авторы описали, какие предпочтения невозможно выявить при постоянных ограничениях выполнимости, и предложили механизм контроля ложных улучшений, действующий в любой момент времени.
Эксперименты проводились на задачах персонализированных рассуждений, контролируемой обратной связи и вызова инструментов. Согласно результатам, FABLE улучшает несколько чувствительных к предпочтениям поведенческих показателей по сравнению с контролем на основе правил, оставаясь конкурентоспособным по общей эффективности выполнения задач.
Главное преимущество подхода — практичность: он работает с закрытыми моделями, не требует дообучения и позволяет учитывать индивидуальные предпочтения в реальном времени. Это делает его перспективным для создания ассистентов и агентных систем, где кастомизация критична, но доступ к параметрам модели ограничен.


