Ученые: высокое совпадение оценок ИИ с людьми не гарантирует морального выравнивания

Ученые: высокое совпадение оценок ИИ с людьми не гарантирует морального выравнивания

Новое исследование, опубликованное на arXiv, посвящено проблеме оценки выравнивания больших языковых моделей. Авторы указывают, что совпадение итоговых суждений ИИ с человеческими не означает глубокого совпадения этических оснований.

В работе использован набор из 500 примеров на основе известного бенчмарка ETHICS, охватывающего пять областей моральных суждений. Для каждого примера были собраны новые аннотации от людей и от моделей: как итоговые метки, так и пояснительные обоснования.

Результаты показали, что по итоговым меткам модели часто демонстрировали высокое согласие с большинством человеческих аннотаторов. Однако когда исследователи сравнили обоснования, обнаружилось систематическое расхождение.

В частности, модели перераспределяют внимание между такими категориями, как вред, уважение, выполнение обещаний, справедливость, заслуженность и значимость извинений — даже в тех случаях, когда итоговая метка полностью совпадает с человеческой.

Авторы заключают: сама по себе итоговая метка не показывает, на каких принципах строится решение. Оценка выравнивания, основанная только на выборе ответа, может давать ложное ощущение безопасности.

Результаты важны для разработки методов контроля ИИ. Для надежного выравнивания необходимо анализировать не только ответы, но и логику рассуждений, этические приоритеты и интерпретацию контекста.

Выравнивание ИИ — одно из ключевых направлений в области безопасности систем искусственного интеллекта. Данное исследование предлагает дополнительный инструмент для оценки поведения моделей.