MultivationBench: мультимодальные ИИ не справляются с последовательным анализом мотиваций

Группа исследователей представила новый бенчмарк MultivationBench, предназначенный для оценки мультимодальных больших языковых моделей (MLLM) в области последовательного рассуждения о мотивациях. Работа опубликована на платформе arXiv и привлекла внимание специалистов по искусственному интеллекту.

Существующие методы оценки социального интеллекта моделей в основном опираются на статичные тексты или отдельные изображения. Такой подход не отражает накопительный характер поведенческих драйверов, которые формируются и меняются с течением времени. MultivationBench призван заполнить этот пробел, предлагая задачи на основе сюжетных визуальных историй.

В основе бенчмарка лежат известные психологические концепции — иерархия потребностей Маслоу и базовые желания Рейсса. Моделям необходимо интегрировать накопленный мультимодальный контекст, чтобы корректно infer эволюционирующие мотивации персонажей. Это требует не просто распознавания отдельных сцен, а построения целостной картины поведения.

Результаты тестирования показали, что MultivationBench представляет собой серьезный вызов для современных моделей. Все протестированные системы испытывают сложности с поддержанием последовательного рассуждения о мотивациях в условиях сменяющихся контекстов. Это указывает на критический разрыв между способностью к статическому распознаванию и динамическим рассуждением, необходимым для человеческого понимания социальных ситуаций.

По мнению авторов, полученные данные подчеркивают важность разработки новых подходов к обучению моделей, которые бы учитывали временную динамику и накопление информации. Без этого сложно рассчитывать на создание по-настоящему социально интеллектуальных ИИ-систем, способных адекватно взаимодействовать с людьми.

Исследование носит академический характер и не связано с какими-либо коммерческими продуктами. Оно может стать отправной точкой для дальнейших работ в области мультимодального понимания и рассуждений.