Ученые: тесты моральных качеств ИИ игнорируют нормы поведения
Новое исследование, опубликованное на arXiv, указывает на серьезный пробел в оценке моральных качеств больших языковых моделей. По мнению авторов, текущие бенчмарки проверяют лишь соответствие выводам человеческим ценностям, но почти не анализируют, способна ли модель применять контекстные моральные нормы.
Авторы выделяют две задачи: проблему моральной ценности и проблему моральной нормы. Первая широко изучается, вторая остается без должного внимания. Причина, как считают исследователи, в опоре на описательные этические теории, которые подчеркивают представление ценностей, а не их нормативное применение.
В работе проанализированы существующие бенчмарки и методы оценки. Оказалось, что большинство из них группируются вокруг проблемы ценностей, тогда как нормативные аспекты остаются в тени. Это создает искаженную картину моральных возможностей ИИ.
Ученые выделили три ключевых пробела. Во-первых, отсутствуют качественные данные для изучения моральных норм и их применения. Во-вторых, недостаточно оцениваются промежуточные процессы рассуждения. В-третьих, мало внимания уделяется выявлению морально значимых особенностей в контексте.
Для решения этих проблем предложена исследовательская программа. Она включает создание стандартизированных формальных представлений нормативных теорий, построение датасетов с экспертной разметкой применения норм и разработку протоколов оценки, разделяющих компетенции уровня ценностей и уровня норм.
Авторы надеются, что это приведет к более систематическому изучению нормативных рассуждений в больших языковых моделях. Работа носит постановочный характер и предлагает направление для будущих исследований в области этики ИИ.







