ИИ-модели уперлись в потолок персонализации: новый бенчмарк оценил их в продажах

Крупные языковые модели (LLM) достигли впечатляющих успехов в генерации текста, но их способность к персонализации — адаптации сообщения под конкретного человека — остаётся ограниченной. К такому выводу пришли авторы нового исследования, опубликованного на arXiv (2607.20471). Они разработали бенчмарк SDR-Bench, включающий 6279 реальных историй успешных продаж из 22 отраслей и около 200 компаний.
В отличие от предыдущих тестов, которые оценивали лишь подстройку под самого пользователя модели, новая работа изучает классическую задачу персонализации: может ли сгенерированное сообщение побудить к действию третье лицо. Для этого исследователи адаптировали концепцию байесовского убеждения (Bayesian Persuasion) и создали симуляцию с временными ограничениями, исключающую утечку будущих данных.
При тестировании передовых LLM и deep-research агентов был обнаружен устойчивый «плато персонализации»: ни одна модель не смогла статистически значимо отделить успешные обращения от неудачных. Проверка на группе технологических компаний из списка Fortune 100 подтвердила результат — модели не превзошли случайный уровень.
Впрочем, практическое применение оказалось более обнадёживающим. В полевом эксперименте с участием 12 профессиональных менеджеров по продажам 48% сгенерированных моделью сообщений были признаны немедленно полезными. Согласованность с оценками старших экспертов достигла коэффициента Пирсона 0,82.
Авторы отмечают, что текущий подход к персонализации в LLM — генерация множества вариантов на основе предполагаемого состояния получателя — пока не даёт гарантированного результата. Отсутствие явного моделирования целей обеих сторон (отправителя и получателя) может быть причиной «потолка».
Исследователи открыто публикуют SDR-Bench и SDR-Arena для поддержки воспроизводимых исследований в области генеративной персонализации. Работа может помочь улучшить алгоритмы, используемые в автоматизации продаж, маркетинге и клиентском сервисе.






