Оценка интерпретируемости ИИ: методология важнее архитектуры — выводы нового исследования
Новое исследование, опубликованное на arXiv, ставит под сомнение достоверность сравнений интерпретируемости разреженных автоэнкодеров (SAE) в разных работах. Учёные обнаружили, что методологические различия в процедуре оценки вносят больший вклад в разброс результатов, чем различия в архитектурах моделей.
В ходе экспериментов использовались два языковых модели — Pythia-160M и Apertus-8B, четыре метрики (симуляция, детекция, фаззинг, чистота) и четыре оси методологических вариаций. Выяснилось, что методологическая дисперсия стабильно превышает архитектурную по всем метрикам и моделям.
Каждая метрика показала свой уровень нестабильности: детекция оказалась наиболее стабильной, а фаззинг — ненадёжным во всех условиях. Кроме того, ранжирование топ-k признаков не сохранялось при изменении корпуса и условий выборки, что маскирует нестабильность отдельных признаков за устойчивыми средними значениями.
Это означает, что сравнения результатов разных статей по показателям автоматической интерпретируемости могут отражать различия в конвейере оценки, а не в архитектурных решениях. Такая ситуация замедляет прогресс в исследованиях интерпретируемости, которые необходимы для создания надёжных инструментов понимания ИИ-систем.
Для решения проблемы авторы предлагают метод декомпозиции дисперсии, инструмент Stability Check и минимальный отчётный чеклист. Эти инструменты помогут исследователям точнее оценивать стабильность результатов и делать корректные сравнения.
Работа затрагивает фундаментальный вопрос: насколько мы можем доверять текущим метрикам интерпретируемости? По мнению авторов, без устранения эффекта конвейера дальнейшие сравнения и выводы о качестве SAE могут быть некорректными.


