Ученые нашли условия, при которых внутренние представления ИИ структурно сходятся
Научная группа опубликовала на arXiv препринт, посвященный устойчивости внутренних представлений нейросетей. Работа затрагивает фундаментальный вопрос: почему разные модели машинного обучения, обученные независимо, часто формируют схожие скрытые структуры? Авторы предложили теоретическую основу для объяснения этого феномена.
В центре исследования — транзьюсеры, математические модели управляемых случайных процессов, которые широко используются для описания последовательных данных. Рассматриваются три типа: стандартные, линейные и предсказательные транзьюсеры. Для каждого из них вводится понятие минимального представления — наиболее компактного способа описания динамики процесса.
Ключевая новизна работы — введение понятий аппроксимативного гомоморфизма, который отражает локальное структурное сходство между реализациями, и метрик, сравнивающих индуцированные динамики (интерфейсы). Это позволяет формализовать, насколько близки представления, даже если они не совпадают точно.
Ученые доказали несколько важных свойств. Во-первых, для стандартных транзьюсеров существуют простые интерфейсы, для которых не удается построить приближенный гомоморфизм между разными реализациями динамики. Это означает, что без дополнительных ограничений конвергенция представлений не гарантируется.
Во-вторых, для линейных транзьюсеров ситуация иная. Для любого интерфейса конечного ранга все минимальные линейные реализации, достаточно близкие к этому интерфейсу, имеют приближенный гомоморфизм к минимальной реализации самого интерфейса. Ошибка при этом растет линейно с величиной возмущения — это сильный результат, показывающий устойчивость.
Аналогичный результат получен для предсказательных транзьюсеров, но с использованием остаточной метрики и дополнительного условия о неразличимости состояний убеждения. Эти ограничения, как отмечают авторы, выглядят мягкими и естественными для практических задач.
Работа имеет прямое отношение к современным большим языковым моделям. Если внутренние представления таких моделей содержат встроенные абстракции, аналогичные транзьюсерам, то доказанные теоремы дают теоретическое обоснование наблюдению, что латентные представления разных моделей демонстрируют структурную сходимость. Иными словами, ИИ-системы, решая схожие задачи, могут приходить к общим внутренним понятиям, и это не случайность, а закономерность, вытекающая из математической устойчивости.
Исследование не только объясняет известный феномен, но и открывает пути к более предсказуемому анализу и интерпретации внутренних механизмов нейросетей, что важно для развития объяснимого ИИ и контроля качества моделей.


