DocOCR-Eval: фреймворк для выбора OCR без разметки данных

При обработке документов — от простого сканирования до сложных систем вопросно-ответного анализа — ключевым этапом остаётся распознавание текста. На рынке представлены десятки OCR-движков и мультимодальных больших языковых моделей (MLLM), однако выбор оптимального решения для конкретного набора документов часто затруднён из-за отсутствия размеченных данных.

Группа исследователей представила на arXiv препринт, в котором описывается DocOCR-Eval — безаннотационный фреймворк для автоматической оценки и выбора OCR-инструментов. Метод основан на трёхстадийной стратегии: коррекция ошибок, ранжирование и агрегация результатов нескольких MLLM.

Эксперименты проводились на нескольких бенчмарках сканированных документов из разных доменов и на разных языках. Авторы сравнили производительность популярных OCR-движков и современных MLLM. Оказалось, что агрегирование ответов от нескольких мультимодальных моделей постепенно улучшает согласованность с эталонным ранжированием, полученным традиционным способом.

DocOCR-Eval решает проблему высокой стоимости ручной разметки и отсутствия контекстных рассуждений у многих стандартных OCR-систем. Фреймворк позволяет достичь надёжного выбора инструментов даже в условиях ограниченного количества размеченных образцов.

Практическая значимость работы — возможность быстро подобрать оптимальное решение для распознавания документов в реальных сценариях: от архивов и библиотек до корпоративного документооборота. Это упрощает внедрение систем автоматической обработки документов без предварительных инвестиций в создание дорогостоящих датасетов.

Полный текст исследования доступен на arXiv по идентификатору 2607.16203.