ИИ-ассистенты не справляются с персонализацией в финансах: представлен бенчмарк FinPerMA

Языковые модели всё чаще используют в качестве персональных финансовых советников, но насколько хорошо они умеют удерживать и обновлять модель пользователя на длительном горизонте? Чтобы ответить на этот вопрос, исследователи представили новый бенчмарк FinPerMA.

FinPerMA — это событийно-ориентированный тест, построенный на основе замороженных продольных траекторий инвесторов. В отличие от существующих бенчмарков, которые проверяют в основном удержание фактов или используют слабо ограниченные сгенерированные данные, FinPerMA делает акцент на адаптации предпочтений по мере возникновения значимых событий.

Процесс генерации включает детерминированные правила влияния, управляемое повествование от LLM и автоматический контроль качества. Отдельная контрольная точка Post-Shock позволяет проверить, учитывает ли агент материальное событие в своей постоянной модели пользователя.

Результаты оказались невысокими: на 2994 вопросах из 276 персон семь ведущих LLM и до семи конфигураций памяти не достигли насыщения. Ни одна конфигурация с полным контекстом не превысила примерно 47% общей точности и около 39% на вопросах с множественным выбором.

Атрибуционный анализ показал, что саммари-память часто сохраняет фактические детали, но теряет сигналы предпочтений, критичные для персонализации. Простой поиск по базе может обойти специальные системы памяти, причём разрыв увеличивается после экономических шоков.

По словам авторов, разработчикам финансовых ИИ-ассистентов стоит пересмотреть подходы к памяти и персонализации, а также учитывать реальные события, влияющие на предпочтения клиентов. FinPerMA может стать инструментом для стандартизации оценки таких систем.

Пока бенчмарк остаётся исследовательским, но он уже показывает: путь к надёжным персональным советникам на базе ИИ длиннее, чем предполагалось.