TGO-IV: топологический анализ показал, как трансформеры учатся по слоям
Научная группа представила четвёртую версию своего инструмента Transformer Geometry Observatory (TGO-IV), предназначенного для изучения внутренней работы трансформеров. В отличие от традиционных подходов, анализирующих отдельные слои или сеть в целом, новая работа фокусируется на том, как меняются представления данных при прохождении через последовательность слоёв.
Авторы используют топологический аппарат, в частности персистентную гомологию, чтобы строить симплициальные комплексы Вьеториса-Рипса из облаков точек, соответствующих векторным представлениям токенов. Это позволяет рассматривать не локальные геометрические свойства, а глобальные топологические сигнатуры, которые сохраняются при преобразованиях.
В состав фреймворка входят несколько взаимодополняющих наблюдательных инструментов: диаграммы персистентности, штрих-коды, кривые Бетти, персистентные ландшафты, а также расстояния бутылочного горлышка и Вассерштейна. С их помощью исследователи могут проследить, как форма распределения представлений эволюционирует от «сырого» входа до сложных признаков, значимых для решения задачи.
По словам авторов, подобный анализ позволяет изолировать отдельные слои или выявить тенденции, которые приближают к ответу на вопрос о том, как именно трансформеры обучаются. Это может помочь в разработке более интерпретируемых моделей и диагностике их поведения.
Работа размещена на платформе arXiv и находится на стадии препринта; она ещё не проходила полноценное рецензирование. Тем не менее предложенный подход продолжает линию исследований, направленных на создание «микроскопа» для внутренних процессов больших языковых моделей.
Интерес к интерпретируемости архитектур на основе внимания растёт по мере их распространения в задачах обработки языка и компьютерного зрения. TGO-IV предлагает новый угол зрения: не просто смотреть на активации, а изучать топологические инварианты, которые формируются в процессе прямого прохода.







