Система RAIL Guard повышает эффективность исправления ошибок ИИ-агентов до 97%

Современные системы защиты для больших языковых моделей (LLM) работают как бинарные классификаторы: они блокируют небезопасный контент, но не предлагают способов его исправления, заставляя организации отбрасывать неудачные результаты и начинать заново. Это неэффективно: до половины попыток оканчиваются неудачей.

Новый подход — RAIL Guard — представляет собой замкнутый конвейер ответственного ИИ, который не только выявляет проблемы, но и исправляет их через цикл «оценка-переписывание-переоценка». Система анализирует выводы LLM по восьми измеримым параметрам, включая безопасность, прозрачность, подотчетность и инклюзивность.

В экспериментах на четырёх ведущих LLM, 4276 образцах контента и 6400 сценариях вызовов инструментов закрытое исправление достигло 96,9% сходимости против 49,1% для метода блокировки и повтора. Однако метод с наибольшей сходимостью снизил полезность на 22,3%.

Более сбалансированный подход — самоисправление с обратной связью — показал 86,6% сходимости по исправляемым параметрам без значительной потери полезности (p = 0,177). Оценка перед вызовом инструментов сократила количество небезопасных действий агента на 33% (p = 0,007) с нулевым влиянием на выполнение задачи.

Исследователи также выявили важное различие между исправляемыми и структурными параметрами. Такие аспекты, как прозрачность (93,0% отказов), подотчетность (92,8%) и инклюзивность (82,5%), требуют не алгоритмических, а архитектурных решений. Это означает, что некоторые проблемы необходимо решать на уровне дизайна системы, а не постфактум.

Система RAIL Guard доступна в виде открытых SDK, что позволяет разработчикам интегрировать её в свои проекты. Результаты исследования опубликованы на arXiv.