Нормализация вознаграждений улучшила обучение языковых моделей на 20%
Исследователи из международной научной группы представили новый подход к оптимизации языковых моделей на основе предпочтений пользователей. В работе, опубликованной на arXiv, они предложили метод нормализованных вознаграждений, который решает проблему переоптимизации в алгоритмах прямого выравнивания (DAA), таких как DPO и SimPO.
Проблема классических DAA заключается в том, что они чрезмерно увеличивают вероятность предпочтительных ответов за счёт снижения общего правдоподобия выбранных вариантов. Это может приводить к нежелательному поведению модели и ухудшению её генеративных способностей.
Авторы проанализировали, как распределяются изменения вероятностей ответов по токенам. Они обнаружили, что основная часть изменений приходится на небольшое количество «выбросов» — токенов с аномально низкими или высокими вероятностями. Именно за счёт этих токенов алгоритмы улучшают качество генерации, несмотря на общее снижение правдоподобия выбранных ответов.
Для устранения негативных эффектов исследователи ввели регуляризацию, которая сохраняет нормированные вероятности выбранных и отвергнутых ответов. Этот метод был применён как к reference-based (DPO), так и к reference-free (SimPO) подходам.
Эксперименты на модели Llama-3.1-8B-Instruct показали значительные улучшения. AlpacaEval2 вырос более чем на 20% относительно базовой модели, а общие бенчмарки — более чем на 9%. Кроме того, регуляризация эффективно уменьшила смещение вероятностей в предпочтительных ответах, особенно для токенов-выбросов.
По мнению авторов, предложенный метод позволяет достичь лучшего баланса между качеством генерации и производительностью на общих задачах. Работа открывает новые возможности для более устойчивого выравнивания больших языковых моделей с человеческими предпочтениями.



