Новый метод повышает достоверность объяснений LLM без переобучения
Исследователи представили метод, который повышает достоверность объяснений больших языковых моделей на этапе инференса. Работа опубликована в архиве препринтов arXiv.
Как отмечают авторы, объяснения ИИ могут быть неполными или необоснованными. Неполнота означает, что в объяснении не упомянуты факторы, которые на самом деле повлияли на ответ. Необоснованность — когда модель ссылается на факторы, не оказавшие влияния. Большинство существующих тестовых методов борются только с необоснованностью.
Новый подход направлен на неполноту. Алгоритм убирает из входа те концепции, которые модель не упомянула в своём объяснении, и заново запрашивает ответ на сокращённый ввод. Это исключает скрытые влияния, сохраняя влияние упомянутых концепций.
Метод протестирован на двух наборах данных и нескольких семействах моделей. Авторы использовали две независимые метрики точности объяснений. Результаты показали улучшение по сравнению со стандартным промптингом и инструкциями, поощряющими честность.
Преимущество подхода — он не требует доступа к весам модели или вычислительных ресурсов для обучения. Применение на этапе вывода делает его гибким инструментом для снижения скрытых влияний и повышения надёжности решений, принимаемых с помощью ИИ.



