ИИ-поиск по сложным PDF достиг рекордной точности 99% с помощью тройной фильтрации
Поиск информации в сложных PDF-документах, содержащих текст, таблицы, графики и изображения, остаётся серьёзной задачей для систем искусственного интеллекта. Особенно трудно выполнять многошаговые запросы, требующие сбора разрозненных фактов. В новой научной работе на arXiv представлена система Multimodal CoLRAG-TF, которая решает эту проблему с помощью комбинированного подхода.
Архитектура системы включает четыре оси извлечения: плотные текстовые эмбеддинги (dense embeddings), лексическое совпадение BM25, фильтрацию по триплетам графа знаний и сравнение изображений. Дополнительно используется грубый-детальный поиск, вдохновлённый HippoRAG2, который последовательно сужает область: от всего тома к главе, затем к блоку.
Для экспериментов авторы подготовили коллекцию из 43 японских PDF-документов с уроками по ликвидации последствий стихийных бедствий. После обработки гибридным OCR и генерации подписей с помощью LLM было извлечено 2403 блока. Из них выделили 11 414 открытых триплетов OpenIE, которые проиндексировали с помощью FAISS — это обеспечило субсекундный поиск по графу.
На тестовом наборе из 457 пар запрос-ответ Multimodal CoLRAG-TF показала полноту поиска (Retrieval Recall) 0,9909, а качество ответов на многошаговые вопросы улучшилось на 71,6% по сравнению с одношаговыми. Баесовская оптимизация весов слияния выявила, что ось триплетов должна доминировать (?_triple = 0,44), чтобы компенсировать лексические смещения.
Кроме того, система поддерживает ввод изображений: с помощью vision-LLM строится конвейер «изображение ? урок», что расширяет область применения. Авторы отмечают, что тройная фильтрация мультимодальных данных критически важна для структурированного рассуждения по зашумлённым и разнородным PDF.
Разработанный фреймворк не ограничен темой стихийных бедствий — он может быть адаптирован для любых сложных PDF-архивов, где требуется точное извлечение фактов и многошаговые выводы.







