StateSight: новый тест показал, что люди точнее GPT-5.5 и Claude Sonnet 5 в пространственных задачах
Группа исследователей опубликовала в архиве arXiv препринт, в котором представила новый бенчмарк StateSight. Он предназначен для проверки способности vision-language моделей восстанавливать скрытую пространственную структуру по одному изображению. Авторы подчёркивают, что существующие комплексные тесты часто смешивают восприятие, распознавание текста, фоновые знания и рассуждения, из-за чего сложно изолировать именно пространственный компонент.
StateSight включает три семейства заданий: определение противоположных граней на развёртке куба, подсчёт частично скрытых башен из кубов и подсчёт связных компонентов по четырёхсоседней схеме. Каждое семейство состоит из 300 сгенерированных заданий с детерминированными эталонными ответами и точным сопоставлением результата. Такой подход позволяет объективно сравнить разные модели.
В ходе эксперимента OpenAI GPT-5.5 с идентификатором модели gpt-5.5 показал точность 59,3%, 33,3% и 28,3% на трёх типах заданий соответственно. Claude Sonnet 5 справился слабее: 53,3%, 18,7% и 7,3%. При этом во всех финальных запусках модели не допустили ни одной ошибки формата — их ответы были синтаксически корректны, но содержали неверные пространственные выводы.
Для сравнения авторы провели контрольное тестирование с участием 30 человек. На выборке из 60 заданий люди набрали в среднем 80,8%, 68,8% и 64,3% — то есть превзошли обе модели во всех трёх задачах. Это указывает на то, что современные vision-language модели испытывают фундаментальные трудности с восстановлением пространственной структуры, хотя и умеют генерировать правдоподобные ответы.
Дополнительно в работе описан набор данных StateSight-Steps, содержащий 900 перемежающихся примеров изображений и текста, а также 3600 детерминированных промежуточных визуальных состояний. Этот набор позволяет анализировать, на каком этапе модель теряет нужную информацию. Авторы отмечают, что видимый анализ цепочек рассуждений выявил повторяющиеся ошибки при реконструкции состояния изображения и в самой процедуре рассуждения.
Результаты исследования поднимают вопрос о надёжности оценки мультимодальных моделей: корректный формат ответа не гарантирует, что модель действительно выполняет зрительное умозаключение. Предложенный бенчмарк может стать инструментом для более точного измерения пространственных способностей ИИ и стимулировать разработку новых подходов к обучению.



