Гиперградиентный алгоритм двухуровневого RL: без гессиана и с рекордной эффективностью выборки
Научная группа опубликовала на arXiv описание нового алгоритма двухуровневого обучения с подкреплением (bilevel RL), который одновременно решает две ключевые проблемы: высокую вычислительную сложность и чрезмерную потребность в данных. Работа доступна по ссылке arXiv:2607.28849.
Двухуровневое RL используется для формализации таких задач, как мета-обучение, иерархическое разложение действий и обучение с подкреплением на основе обратной связи от человека (RLHF). Однако большинство существующих алгоритмов либо масштабируются плохо из-за использования гиперградиента с гессианом, либо требуют огромного количества выборок из-за штрафных приближений.
Предложенный метод строится на основе оптимальности политики Больцмана для энтропийно-регуляризованной задачи RL с дисконтированием. Это позволяет полностью отказаться от вычисления гессиана, что делает алгоритм существенно более лёгким с вычислительной точки зрения.
Авторы показывают, что их алгоритм достигает сложности итераций O(???) и передовой сложности выборки O(???) при мягких условиях регулярности. Для сравнения, предыдущие методы с аналогичной сложностью выборки требовали дополнительных предположений, таких как условие Поляка–Лоясиевича (PL) для целевой функции внешнего уровня.
Важное достижение работы — снятие PL-предположения. Это означает, что новый алгоритм применим к более широкому классу задач, включая те, где внешняя цель не удовлетворяет этому ограничению.
Разработка имеет прямое отношение к практическим системам RLHF, которые лежат в основе современных больших языковых моделей. Снижение требований к выборке и вычислительным ресурсам может ускорить их обучение и удешевить настройку.
В публикации представлен теоретический анализ сходимости. Экспериментальная часть в аннотации не описана, но авторы утверждают, что алгоритм работает в условиях мягкой регулярности, что подтверждает его потенциальную практическую значимость.
Новость подготовлена по материалам открытой научной публикации.







