Усреднение предпочтений в RLHF нарушает справедливость: метод PA-RLHF сокращает разрыв

Исследователи представили работу, в которой показали, что стандартный подход к обучению с подкреплением на основе обратной связи от человека (RLHF) может систематически игнорировать предпочтения меньшинств. Причина — усреднение разнородных предпочтений при построении единой модели вознаграждения.
Авторы исходят из того, что алгоритм предполагает однородность предпочтений пользователей. Если же группа людей оценивает ответы модели по-разному, усреднение приводит к доминированию большинства: их мнение сильнее влияет на обучение, а позиции меньшинств оказываются недопредставленными.
Чтобы оценить масштаб проблемы, исследователи ввели понятие процедурной справедливости в выравнивании ИИ. Оно подразумевает сохранение различных сигналов предпочтений на этапе моделирования вознаграждения. Стандартный RLHF, как утверждается, нарушает это требование.
В качестве решения предложен метод Preference-Aware RLHF (PA-RLHF). Он разделяет оптимизацию по разным режимам предпочтений уже на этапе обучения модели вознаграждения, а не после него.
В контролируемом эксперименте PA-RLHF повысил общую точность выравнивания с 46,9% до 67,9%. Кроме того, разрыв в качестве выравнивания между лучшей и худшей группами сократился с 15,9 до 9,6 процентных пункта.
По словам авторов, результаты показывают, что сбои процедурной справедливости могут возникать из-за структурных решений в дизайне обучения вознаграждению. Это наблюдается даже в контролируемых условиях без шума.
Особое значение работа имеет для больших языковых моделей и агентных систем, где смещённая модель вознаграждения может усиливать неравенство в последовательных решениях.







