Новое исследование: фильтры безопасности не устраняют вредоносные ответы LLM полностью
Группа исследователей представила работу, в которой изучается, способны ли современные схемы выравнивания (alignment) вместе с ограниченными фильтрами безопасности полностью устранить вредоносное поведение больших языковых моделей (LLM). Статья опубликована на arXiv под названием On the Limits of Support-Preserving Alignment and Bounded Filtering.
Авторы формализовали задачу с помощью операторов выравнивания, сохраняющих поддержку распределения, и алгоритмов ограниченной фильтрации при различных типах доступа к модели: black-box, white-box и статистические запросы. Они привели теоретические аргументы, указывающие, что при таких ограничениях фильтрация может не справиться с удалением всех вредоносных выходов, поддерживаемых исходным распределением модели.
Для эмпирической проверки гипотезы ученые протестировали несколько современных открытых и хостинговых LLM через платформу OpenRouter. В качестве тестовых сценариев использовались adversarial-запросы из подготовленных наборов по кибербезопасности и датасета PKU-SafeRLHF. Оценка проводилась при разных бюджетах запросов и типах фильтров.
Результаты показали, что с увеличением вычислительных затрат на фильтрацию частота вредоносных ответов снижается, но стабильно выходит на плато выше нуля. Исследователи назвали это явление persistent empirical harm floor — устойчивый эмпирический уровень вредоносности, который не удается преодолеть.
Работа поднимает важные вопросы о фундаментальных ограничениях современных методов безопасности LLM. Хотя фильтры и выравнивание подавляют наиболее явные формы вредоносного поведения, полностью искоренить его, судя по всему, не удается. Это означает, что разработчикам и пользователям языковых моделей следует учитывать наличие такого остаточного риска.
Исследование носит теоретический и экспериментальный характер и не содержит конкретных рекомендаций для регуляторов или разработчиков, однако оно подчеркивает необходимость дальнейших изысканий в области безопасного ИИ.







