Ученые обнаружили у ИИ стабильное отношение к риску
Группа исследователей представила работу, в которой изучается, как крупные языковые модели (LLM) принимают решения в условиях неопределенности. Авторы ввели понятие «отношение к риску» как устойчивой характеристики поведения ИИ, до сих пор не описанной в литературе.
В рамках эксперимента были задействованы шесть различных LLM и 100 участников-людей. Им предлагались задачи из трех областей: пространственная навигация, клиническая триажная сортировка и финансовое распределение ресурсов. Каждая задача требовала оценки вероятности и выбора действия.
Методология включала регрессионный анализ для отделения контекстных представлений о риске от категориальных решений. Это позволило количественно измерить чувствительность к риску и смещение (bias) в отношении риска у каждого агента.
Основные результаты показали три закономерности. Во-первых, внутри одной задачи LLM демонстрировали высокую согласованность: их реакции на изменения вероятностей были стабильны. Во-вторых, относительная позиция модели по шкале «риск-осторожность» сохранялась при переходе между разными задачами. В-третьих, распределение типов отношения к риску у LLM оказалось более узким по сравнению с человеческим разнообразием — модели сближались к некоторому «усредненному» поведению.
По словам авторов, эти результаты закладывают основу для оценки и выравнивания ИИ в открытых сценариях принятия решений. Обнаружение стабильного отношения к риску у LLM поднимает вопросы о происхождении таких внутренних предрасположенностей.
Работа размещена на сервере препринтов arXiv и привлекает внимание специалистов по безопасности ИИ. Дальнейшие исследования могут быть направлены на изучение факторов, формирующих рисковое поведение моделей, и на способы его корректировки.







