Мультимодальные ИИ провалили тест на абстрактное мышление: люди точнее в 8 раз
Группа исследователей представила новый бенчмарк The Unwritten Benchmark, предназначенный для проверки абстрактного перцептивного мышления у мультимодальных моделей искусственного интеллекта. Результаты оказались показательными: современные ИИ значительно уступают людям в задачах, требующих синтеза информации из разных сенсорных каналов.
Суть задачи состоит в так называемом акусто-кинематическом выводе слов. Моделям предлагается расшифровать слова, написанные на трех разных языковых стилях, используя только аудиозапись царапания пера и видео движения руки пишущего. При этом сами чернила на бумаге отсутствуют — увидеть написанное невозможно.
В эксперименте участвовали ведущие мультимодальные системы, включая GPT-4o от OpenAI и Gemini 2.5-Pro от Google. Их точность в определении правильной последовательности букв оказалась крайне низкой и не превысила 10 процентов. Для сравнения, люди-участники демонстрировали уверенный результат — более 80 процентов точности.
Особый интерес вызывает так называемый парадоксальный эффект слияния: когда моделям предоставляли одновременно и звуковую, и видеодорожку, их производительность не улучшалась, а наоборот, деградировала по сравнению с использованием только одного из сигналов. Это указывает на фундаментальные проблемы в способности моделей синтезировать взаимодополняющие перцептивные сигналы.
Авторы исследования подчеркивают, что обнаруженные ограничения связаны с недостатками в кросс-модальном причинном мышлении и понимании микро-кинематики движений, которые важны для такого рода когнитивных задач. Модели хорошо распознают статические образы, но не справляются с динамическими процессами, требующими абстрактного вывода.
Этот бенчмарк поднимает важные вопросы о том, насколько полно современные ИИ отражают человеческое восприятие и мышление. Несмотря на впечатляющие успехи в распознавании изображений и речи, они все еще далеки от интуитивного понимания физических процессов, доступного человеку.
Результаты работы опубликованы в виде препринта на платформе arXiv и, вероятно, будут использованы для дальнейшего развития мультимодальных систем, ориентированных на более глубокое понимание окружающего мира.







