Система на Qwen3.5-9B подняла полноту поиска в документах с 70 до 95%

В препринте на arXiv описана новая система извлечения знаний, которая превращает поток разнородных документов в валидированный граф знаний. Разработка ориентирована на производственное использование и решает проблему несогласованности больших языковых моделей при выделении сущностей и связей.

Ключевая особенность — онтологическое управление. Нужный фрагмент онтологии система извлекает из графовой базы данных в реальном времени по эмбеддинг-сходству и подмешивает в промпт модели. Это снижает накладные расходы каталога примерно на 94 процента по сравнению со статичными срезами онтологии.

Для извлечения сущностей и связей используется локальная модель Qwen3.5-9B, дообученная на онтологии. Система принимает метаданные через Kafka, а обработчики поддерживают PDF, электронные таблицы, Office-документы и изображения. Извлечение проходит в два прохода: первый — сущности, второй — связи.

Далее результаты поступают в конвейер уточнения из пяти этапов: очистка, слияние фрагментов, повторный проход для связей, шесть алгоритмов дедупликации без вывода модели и модуль разрешения конфликтов на основе эмбеддингов. Для последнего модуля введён защитный механизм: никакой порог сходства не может отменить его решение о конфликте.

Оценка на корпусах интеллектуальных данных показала рост полноты поиска с примерно 70 до 95 процентов при отсутствии ложных объединений. Также устранены семь классов скрытых ошибок, среди которых — баг, обрезавший исходный текст на один символ, и систематическое дублирование сущностей с титульными префиксами.

Особенно важна возможность работы без внешних API: локальный хостинг модели снижает задержки и повышает конфиденциальность. Архитектура легко масштабируется на большие потоки документов, что делает её привлекательной для корпоративных систем управления знаниями.