LLM-агенты в переговорах о закупках: задержки съедают до трети экономической выгоды

Научный препринт, опубликованный на arXiv, рассматривает поведение больших языковых моделей (LLM) в роли автономных переговорщиков в цепочках поставок. Авторы провели 9840 переговоров между LLM-агентами от OpenAI, Google и Alibaba, сравнивая их с равновесием Байеса — эталонной стратегией для условий неполной информации.

Исследование показало, что в 98,9% случаев агенты приходили к соглашению, а совокупный экономический излишек достигал 95,4% от максимально возможного. Однако на это уходило в среднем почти три раунда переговоров против 1,25 у эталонной модели. Такая задержка, по оценке авторов, приводит к потере от 21% до 34% потенциальной выгоды.

Отдельно авторы выделили проблему надежности. Базовые версии моделей в 19,2% случаев соглашались на контракты, противоречащие их собственным интересам. У моделей среднего уровня и флагманских версий этот показатель составлял от 0 до 0,6%. Поэтому автоматизированная проверка прибыльности сделки становится ключевым механизмом контроля, подчеркивают исследователи.

Распределение выгоды между участниками оказалось связано не столько с вычислительной мощностью, сколько с принадлежностью модели к той или иной компании. В сценариях, где агент покупателя и агент продавца принадлежали одному разработчику, доля покупателя составляла около 40% у OpenAI, 50% у Google и 70% у Alibaba (модель Qwen). При смене поставщика на противоположную сторону деление менялось на 7–18 процентных пунктов.

Авторы также обратили внимание на роль промпта. Делегирование полномочий разделяет экономическое терпение принципала и стратегическое терпение агента, задаваемое инструкцией. Именно этот фактор, по их данным, объясняет до 90% дисперсии в распределении излишка между сторонами.

В совокупности исследование предлагает рассматривать работу LLM-агентов в переговорах по трем осям: эффективность с учетом дисконтирования, профиль распределения выгоды и операционная надежность. Такой подход, по мнению авторов, может стать основой для стандартизированного аудита ИИ-систем, принимающих экономические решения.