ИИ-модели хуже защищены от предвзятости на неанглийских языках — исследование
Исследователи опубликовали на arXiv работу, посвященную проблеме безопасности языковых моделей за пределами английского языка. Авторы утверждают, что стандартное выравнивание безопасности (safety alignment) в LLM ориентировано преимущественно на английский, из-за чего модели могут пропускать вредные или стереотипные высказывания на других языках.
Для количественной оценки этого разрыва была создана тестовая выборка INCLUDE (Indian Cultural Lens for Understanding and Detecting Embedded Biases). Она включает 2604 промпта на шести языках: английском, хинди, бенгальском, маратхи, тамильском и хинглише (смесь хинди и английского). Цель — выявить социокультурные предубеждения, значимые для Индии.
Авторы протестировали десять открытых и закрытых LLM, получив 14 988 оценок предвзятости. Статистический анализ показал два основных результата. Во-первых, среди открытых моделей самый высокий средний балл предвзятости оказался на бенгальском языке. Во-вторых, английский язык продемонстрировал противоположную динамику: в открытых моделях он дал самый низкий уровень предвзятости, а в закрытых — самый высокий.
По мнению исследователей, это указывает на серьезный недостаток текущих подходов к безопасности ИИ. Голосовые помощники и диалоговые системы, работающие на неанглийских языках, могут воспроизводить стереотипы, несмотря на стандартные фильтры. Для Индии, где население говорит на сотнях языков, это особенно критично.
Разработчики подчеркивают, что без учета локального культурного контекста безопасность ИИ остается неполной. Предложенный бенчмарк может помочь в создании более инклюзивных систем контроля качества для мультиязычных моделей.


