Новый метод выравнивает политики RL по справедливости без переобучения
Группа исследователей опубликовала на arXiv статью, посвящённую новой технике согласования политик в глубоком обучении с подкреплением (RL). Авторы предлагают способ корректировать поведение уже обученного агента в момент инференса, без необходимости переобучать модель. Это позволяет адаптировать политику под новые критерии, например, под требования справедливости, которые не были заложены при первоначальном обучении.
Как отмечается в работе, стандартные RL-агенты обычно оптимизируют скалярную функцию вознаграждения и после развёртывания становятся жёсткими — их сложно подстроить под изменившиеся предпочтения заинтересованных сторон. Существующие подходы к достижению справедливости в RL, как правило, требуют заранее известных предпочтений и полного переобучения политики под новую метрику. Авторы ставят задачу управлять политикой на этапе вывода, что напоминает методы выравнивания на инференсе в больших языковых моделях.
В качестве решения предложена формализация задачи выравнивания справедливости на инференсе как формирования политики (policy shaping). Разработанная мультипликативная схема корректирует вероятности действий агента с помощью зависящих от действия оценок благосостояния. Такой подход не требует модификации базовой политики и совместим с любым агентом глубокого RL.
Эксперименты проводились в нескольких доменах. По данным авторов, предложенный метод значительно улучшает целевые показатели справедливости, связанные с благосостоянием, при этом сохраняя основную производительность агента. Результаты демонстрируют, что выравнивание на инференсе может быть практичной альтернативой полному переобучению.
Работа продолжает линию исследований, переносящих идеи выравнивания из области больших языковых моделей в классическое обучение с подкреплением. По мнению авторов, это открывает путь к более гибким и адаптируемым системам ИИ, которые можно быстро настраивать под новые этические или социальные требования без затратных вычислительных процедур.
Исследование носит теоретико-прикладной характер и, как сообщается, может быть полезно для разработчиков RL-систем, сталкивающихся с необходимостью учёта требований справедливости после развёртывания.


