ИИ-модели плохо понимают сюжеты фильмов: новый бенчмарк показал 61% точности
Группа исследователей представила в arXiv новый подход к оценке мультимодальных языковых моделей: они создали бенчмарк, проверяющий, насколько хорошо ИИ понимает сюжет и нарративные элементы популярных голливудских фильмов. Работа опубликована в виде препринта под идентификатором 2608.21430.
Авторы отмечают, что мультимодальные модели всё чаще используются для крупномасштабного компьютерного анализа кино, что открывает новые возможности для изучения истории кино и эволюции повествовательных техник. Однако создание стабильных бенчмарков на основе голливудских фильмов затруднено авторскими правами.
Чтобы обойти эту проблему, исследователи собрали коллекцию голливудских фильмов по двум критериям: кассовая популярность и вероятный статус общественного достояния. Они опубликовали первый крупномасштабный открытый набор данных о еженедельных кассовых сборах журнала Variety с 1922 по 1979 год, а также исследовали регистрацию и продление авторских прав в Каталоге авторских прав США.
На основе этой коллекции был создан мультимодальный бенчмарк с множественным выбором ответов (MCQ). Задания напрямую проверяют способность моделей анализировать элементы повествования, что, по мнению авторов, должно помочь в проведении содержательных исследований кинонарратива.
Результаты тестирования показали, что многие vision-language модели испытывают серьёзные трудности: их точность близка к случайному угадыванию. Лучшие результаты продемонстрировали аудиовизуальные модели, включая те, что используют звук при описании сцен, — их максимальная точность составила 61,1%. Это, как подчёркивают исследователи, значительно ниже человеческого уровня.
По данным источника, работа носит научный характер и направлена на создание открытых инструментов для анализа кино. Авторы не делают выводов о практическом применении моделей в кинопроизводстве, но отмечают необходимость дальнейшего совершенствования мультимодальных систем для понимания сложных нарративных структур.
Исследование может быть полезно для разработчиков ИИ, занимающихся видеопониманием, а также для специалистов в области цифровых гуманитарных наук, изучающих кино большими данными. Открытые данные о кассовых сборах и статусе авторских прав также могут послужить основой для будущих работ в этой области.


