Исследование: 53% сбоев ИИ остаются незамеченными из-за «слепоты оценки»
Научная работа, опубликованная на arXiv, вводит понятие «слепота оценки» (evaluation blindness). Это ситуация, когда измерительная система показывает, что всё в порядке, в то время как ИИ уже даёт сбои. При этом никакой вспомогательный сигнал не указывает на проблему.
Исследователи отмечают, что проблема проявляется на двух ключевых этапах жизненного цикла ИИ. При обучении модели могут «играть» с функциями вознаграждения, а поправки на важность выборки тихо считаются неверно. Бенчмарки могут быть загрязнены, что завышает результаты, при этом кривые потерь выглядят здоровыми, и градиенты обновляются нормально.
На этапе эксплуатации мониторинг не замечает шесть классов производственных сбоев. Один из них — операционный класс — по своей структуре является на 100% молчаливым. Авторы подчёркивают, что такие сбои невозможно обнаружить стандартными метриками.
Для проверки концепции специалисты проанализировали 50 реальных инцидентов из судебных документов и регуляторных отчётов. Выяснилось, что 53% подтверждённых публичных сбоев были тихими — то есть их не замечали до тех пор, пока ущерб не становился очевидным.
В работе приводятся конкретные примеры. В одном случае ошибка в коде библиотеки TRL, связанная с PR #6594, приводила к порче градиентов при нормальном снижении функции потерь. Эта проблема оставалась незамеченной именно из-за того, что стандартные измерения не давали тревожных сигналов.
Авторы предлагают формальный «предикат обнаруживаемости», который объединяет этапы обучения и эксплуатации. Также представлена шестиклассовая таксономия сбоев и «бюджет сбоев» — подход, привязывающий допустимый уровень ошибок к классу риска использования системы. По мнению исследователей, инфраструктура измерений должна рассматриваться как часть обеспечения корректности ИИ на всём жизненном цикле, а не только на этапе оценки.
Данные, код и схему таксономии авторы опубликовали в открытом доступе на GitHub, что позволяет другим исследователям проверять и развивать предложенные методы.



