SharedSAE: один словарь признаков для разных LLM — эффективная интерпретация моделей
Научная группа опубликовала на arXiv описание метода SharedSAE, который заменяет набор отдельных sparse autoencoders (SAE) для каждой языковой модели единым общим словарём признаков. Это упрощает интерпретацию активаций нейросетей.
В отличие от предыдущих подходов, SharedSAE сохраняет магнитуды активаций, нормализуя только оценочные показатели, и использует dropout моделей для возможности вывода одной модели. Это позволяет применять метод как к группе моделей, так и к отдельной.
Авторы обучили SharedSAE на четырёх базовых языковых моделях масштаба 1B, относящихся к разным семействам и использующих различные токенизаторы. При этом общий словарь признаков сохранил в среднем 96,6% объяснённой дисперсии по сравнению с отдельными SAE.
Кросс-модельные корреляции латентных активаций SharedSAE оказались в 1,8 раза выше, чем у отдельных SAE, выровненных постфактум. Описания латентных признаков также переносятся между моделями.
После заморозки словаря к нему можно быстро адаптировать новые модели, достигая почти такого же качества реконструкции, как у специализированных SAE, но с повторным использованием общих описаний признаков.



