Мультимодальные ИИ путают региональные кухни: представлен бенчмарк CulturalMenuBench
На платформе arXiv опубликован анонс нового бенчмарка CulturalMenuBench, который проверяет способность мультимодальных языковых моделей применять культурные знания в области кулинарии. Авторы отмечают, что современные ИИ достигают почти идеальных результатов в простом распознавании фотографий еды, однако это не гарантирует понимания культурного контекста.
Бенчмарк включает 4870 заданий на 10 языках, охватывающих 18 регионов. В его основе — 10 типов задач, которые объединяют изображения готовых блюд и промежуточных этапов приготовления с ингредиентами, описаниями процессов и региональными метками. Уровень сложности варьируется от базового узнавания до атрибуции блюда к конкретной кухне на основе последовательности приготовления.
В ходе эксперимента были протестированы 12 мультимодальных моделей. Результаты показали значительный разрыв между формальным распознаванием и реальным применением знаний. Если в стандартных заданиях с выбором ответа модели уверенно преодолевали планку в 94%, то при определении принадлежности блюда к региональным кухням Китая их успех не превышал 56% — при том же самом формате с четырьмя вариантами ответа.
Дополнительный диагностический анализ показал, что ошибки моделей распределяются так же, как при случайном угадывании. Успешность решения задач коррелирует не с культурной структурой, а с визуальной различимостью объектов. Примечательно, что многие модели точнее определяют кухню по одному лишь названию блюда, чем по фотографии: разница составила от 7 до 18 процентных пунктов в пользу текста.
По мнению исследователей, это означает, что необходимые знания о кухнях присутствуют в моделях, но не активируются при обработке визуальных данных. Абляционный эксперимент подтвердил, что задачи действительно требуют анализа процесса приготовления: удаление последовательных изображений приготовления приводило к избирательному ухудшению результатов на process-grounded задачах, тогда как другие типы заданий оставались стабильными.
Авторы делают вывод, что почти совершенное распознавание блюд может скрывать неспособность применять культурные знания. Это, по их словам, указывает на необходимость обучения, которое напрямую связывало бы восприятие изображений, процессы приготовления и культурный контекст. Код и данные проекта уже доступны публично.




