Новый бенчмарк DocHop показал: лучшие ИИ-модели заметно слабее людей в сложном анализе документов с графиками

Международная исследовательская группа представила DocHop — новый бенчмарк для оценки мультимодальных больших языковых моделей (MLLM). Он проверяет способность системы интегрировать текстовый контекст и визуальные данные при ответах на сложные, многошаговые вопросы. Результаты показали значительный разрыв между искусственным интеллектом и человеком.

Существующие тесты обычно проверяют модели на графиках или на документах по отдельности. DocHop впервые заставляет ИИ работать с документом, где нарратив задаёт многошаговые ограничения, а графики служат источником числовых значений. Вопрос строится на семантической ссылке из текста: модели нужно сначала понять, о каком объекте идёт речь, затем найти его данные на нескольких графиках и правильно агрегировать информацию.

Авторы сконструировали набор примеров с помощью стохастического логического конвейера. Это позволило управлять глубиной рассуждений и визуальной плотностью задач. Всего в DocHop 2074 примера, разделённых на шесть категорий, что делает тест пригодным для систематического анализа слабых мест моделей.

Эксперименты с широким спектром проприетарных и открытых MLLM показали: ни одна из них не приблизилась к человеческому уровню. Аннотаторы справлялись с заданиями с точностью выше 90%, в то время как лучшая модель достигла лишь 62,83%. Ожидаемо, что варианты с усиленными механизмами рассуждений работают лучше, чем базовые версии.

При этом у всех моделей производительность заметно падает по мере усложнения многошаговых цепочек. То есть рост числа шагов рассуждения остаётся ключевой проблемой для современных MLLM. DocHop выявляет это состояние чётко и воспроизводимо, что делает его удобным контрольным полигоном для будущих исследований.

Появление такого бенчмарка может ускорить разработку моделей, которые не просто распознают графики, а умеют встраивать их в общий смысл документа. Пока же, судя по результатам DocHop, полноценное понимание информационно насыщенных документов с визуализациями остаётся для ИИ открытым вызовом.