Открытый инструмент SIRIN выявляет галлюцинации в ответах больших языковых моделей

Международная команда разработчиков представила открытый инструментарий SIRIN, предназначенный для выявления контекстуальных галлюцинаций в ответах больших языковых моделей (LLM). Утилита ориентирована на системы с дополненной генерацией (RAG), агентные архитектуры и модели, использующие долговременную память. Соответствующий препринт опубликован на платформе arXiv.

Проблема галлюцинаций остаётся одной из ключевых при внедрении LLM в реальные продукты: модели могут уверенно формулировать ответы, которые не соответствуют предоставленному контексту или хранимым знаниям. SIRIN призван автоматизировать поиск таких случаев и объяснить, какие именно фрагменты текста не подтверждены источником.

Инструмент объединяет три основных подхода к детекции: зондирование внутренних представлений модели, оценку неопределённости и верификацию по принципу судьи. Помимо постгенерационной проверки, SIRIN поддерживает предварительную оценку отвечаемости запроса, то есть способен определить до генерации, можно ли вообще ответить на вопрос на основе имеющихся данных.

Решение работает как с открытыми моделями, где доступны внутренние состояния, так и с закрытыми коммерческими API — в этом случае используются только вероятности и текстовые выводы. Анализ возможен на уровне всего ответа и на уровне отдельных промежутков текста, что позволяет выявлять конкретные недостоверные утверждения.

Для практического применения предусмотрен веб-интерфейс, в котором пользователь может загружать тройки контекст-вопрос-ответ и получать оценку галлюцинаций, подсветку неподтверждённых мест и сравнение результатов разных детекторов. Архитектура SIRIN построена по модульному принципу, что упрощает добавление новых алгоритмов.

В демонстрационной части авторы показали работу утилиты на задачах детекции галлюцинаций, оценке отвечаемости запросов и контроле фактологичности в системах с долговременной памятью. Исходный код SIRIN доступен на GitHub под открытой лицензией.