Новый метод проверки фактов ECE позволяет ИИ воздерживаться от ответа при слабых доказательствах
Группа исследователей представила новый подход к автоматической проверке фактов, который позволяет искусственному интеллекту не давать категоричного ответа, если доказательства оказываются слабыми или противоречивыми. Разработка получила название Evidence Chain Evaluation (ECE) — система выборочной проверки фактов на основе оценки цепочки доказательств.
Традиционные методы проверки фактов часто требуют от модели обязательного вынесения вердикта «правда» или «ложь». Однако, как отмечают авторы, это создаёт проблему: система может выдавать уверенные заключения даже при недостаточных, разрозненных или внутренне противоречивых доказательствах. ECE решает эту проблему, разрешая модели воздержаться от ответа и указать неуверенность.
Архитектура ECE представляет собой агента, который использует инструменты для сбора доказательств — веб-поиск, научный поиск и выполнимые проверки. Затем агент возвращает структурированный вердикт с указанием уверенности и метаданными об источниках.
На бенчмарке ECE-Bench система показала стандартную точность 91,6%, покрытие 93,7% и выборочную точность 97,8% на отвеченных запросах. Из 95 случаев модель отложила 6, причём 5 из них пришлись на источники самого низкого уровня надёжности (уровень L4). Это подтверждает, что механизм воздержания работает как защитный инструмент в ситуациях с эпистемически слабыми доказательствами.
Хотя ECE не превзошла сильнейший базовый метод поиска по совокупным метрикам калибровки (ожидаемая ошибка калибровки, показатель Брайера, AURC), авторы подчёркивают чёткий компромисс: система сохраняет высокую точность на отвеченных запросах, делегируя сложные случаи.
Исследование опубликовано на arXiv. Исходный код доступен на GitHub. Разработка может найти применение в системах верификации новостей и факт-чекинга, где важна не только скорость, но и надёжность заключений.


