LLM-агенты в аукционах: лидеры по клиентам не лидируют по прибыли

Агентная коммерция постепенно переходит из области концепций в реальную инфраструктуру: платежные сети, ритейлеры и ИИ-платформы готовятся к тому, чтобы алгоритмы совершали сделки от имени продавцов и покупателей. Однако до сих пор не было систематических тестов того, насколько хорошо языковые модели умеют устанавливать цены в реальных рыночных условиях.

Исследователи представили бенчмарк Bazaar — динамический аукцион закрытого типа с множеством атрибутов. В его основе лежат скрытые предпочтения клиентов, конкурентные агенты, которые адаптируются в реальном времени, и возможность внезапных изменений спроса. При этом заложенные в бенчмарк функции полезности имеют замкнутый вид, что позволяет точно оценивать результаты.

В эксперименте участвовали 11 ведущих LLM от четырех провайдеров. Среди них выделялись Gemini 3.1 Pro и Opus 4.6. По данным исследования, Gemini 3.1 Pro оказался лучшим по привлечению клиентов, но Opus 4.6 показал более высокую прибыль. Таким образом, рейтинг агентов существенно меняется в зависимости от выбранного критерия эффективности.

Особый интерес представляет реакция моделей на шоки спроса. Агенты, которые быстрее всех обучались до этого, как правило, медленнее других пересматривали свои прогнозы после резких изменений. При этом Gemini 3.1 Pro восстанавливался быстрее всех, несмотря на то что не был лидером по прибыли.

В целом даже лучший агент смог получить менее трети прибыли, которую можно было бы достичь при идеальном знании рынка задним числом. Авторы отмечают, что современные LLM уже демонстрируют определенный прогресс в агентной коммерции, однако до полноценной конкурентоспособности им еще далеко.

Результаты работы указывают на необходимость дальнейших исследований в области обучения агентов ценообразованию и адаптации к меняющимся условиям. Появление подобных бенчмарков позволяет более объективно сравнивать модели и выявлять их слабые места.