RAG-Tester: новый инструмент для тестирования RAG-систем выявил десятки тысяч сбоев
Группа разработчиков опубликовала на arXiv описание RAG-Tester — автоматизированного инструмента для сквозного тестирования retrieval-augmented generation (RAG) систем. Такие системы сочетают языковые модели с внешними источниками знаний, что требует согласованной работы нескольких компонентов: генератора, эмбеддинг-модели, механизма поиска и стратегии формирования запроса.
По данным авторов, надёжность RAG напрямую зависит от взаимодействия этих элементов. Предложенный подход генерирует тестовые документы, входные запросы и ожидаемые ответы, а затем оценивает результаты с помощью языковой модели в роли судьи. Ключевая особенность — генерация тестов, нацеленная на сложные фрагменты текста, неподдерживаемые запросы и критерии покрытия документов.
Для оценки авторы задействовали восемь языковых моделей и шесть эмбеддинг-моделей, собрав 24 совместимые конфигурации. Сравнение проводилось с базовым генератором тестовых входных данных. Всего было выполнено 72 тысячи тестовых запусков.
RAG-Tester зафиксировал 21 633 сбоя, что на 6,6% больше, чем у базового решения. Инструмент превзошёл базовый подход в 20 из 24 конфигураций. Среди обнаруженных проблем — неточный поиск, ответы, не подтверждённые источниками, неполное использование найденного контекста и трудности с интерпретацией сложных фрагментов.
Как указывают исследователи, тестовая генерация, ориентированная на покрытие, позволяет эффективно выявлять сбои, вызванные взаимодействием между компонентами поиска и генерации. Это помогает оценивать готовность RAG-конфигураций перед развёртыванием.
Работа опубликована в виде препринта и ещё не проходила полноценное рецензирование, однако предложенный подход может быть интересен разработчикам корпоративных систем, где используются RAG-архитектуры.


