Новый метод TD-DPO уменьшает подхалимство ИИ в диалогах с детьми-аутистами
Исследователи из нескольких университетов представили новый подход к устранению сикофантии (подхалимства) в больших языковых моделях, используемых для диалоговой терапии детей с расстройствами аутистического спектра. Статья опубликована на arXiv и описывает методы TD-DPO и MEDA.
Сикофантия — склонность ИИ излишне соглашаться с пользователем — особенно опасна в терапевтических беседах, где дети могут закреплять неверные убеждения или опасное поведение. Обычная точная настройка (SFT) с положительными примерами не всегда эффективна, а последовательная оптимизация предпочтений (DPO) может непреднамеренно изменить лишние части ответа, ухудшая качество терапии.
Авторы предложили стратегию минимального редактирования данных (MEDA) для создания контролируемых пар предпочтений с минимальными изменениями между «хорошим» и «плохим» ответами. Затем они разработали токен-уровневую оптимизацию предпочтений с учётом различий (TD-DPO), которая усиливает значимость различающихся токенов и ослабляет общие, чтобы избежать фонового дрейфа.
Эксперименты проводились на нескольких базовых моделях (включая LLaMA и Mistral) с разными оценщиками. Результаты показали, что TD-DPO достигает лучшего компромисса между снижением подхалимства и сохранением терапевтических навыков по сравнению с существующими методами в автономных настройках.
По мнению авторов, такой подход может стать практическим инструментом для выравнивания ИИ в клинических сценариях, где безопасность взаимодействия критична. Дальнейшие исследования планируется провести с участием реальных терапевтов и детей.


