Случайные низкоразмерные репараметризации: выведена формула для предсказания успеха обучения нейросетей

Международная группа исследователей опубликовала на arXiv статью, в которой решила давний практический вопрос: насколько большим должно быть скрытое пространство при случайной низкоразмерной репараметризации, чтобы нейросеть достигла области низких потерь. Авторы предложили точную математическую формулу, описывающую этот процесс.

Ключевая идея заключается в том, что вместо полного обновления параметров модели используется замороженное случайное отображение, переводящее небольшой латентный вектор в полное обновление. До сих пор не было ясно, как предсказать минимальный размер такого пространства. Новая работа впервые связывает его со спектром кривизны функции потерь и структурой смещения от исходного состояния к решению.

Авторы выразили известный переход в конической форме и вывели так называемую ориентационно-разрешенную квадратичную мастер-формулу. Она предсказывает остаточную ошибку случайного среза, исходя из кривизны и профиля смещения. В частном случае, когда ориентация не важна, формула сводится к более простой оценке, основанной на гауссовой ширине.

На основе теории исследователи создали метод RaMaN (Random Mapping Networks). Он использует структурированные матрицы Адамара или перегенерируемые гауссовы отображения, что позволяет избежать хранения плотных случайных матриц размером O(dP). Это снижает потребление памяти для состояния оптимизатора с O(P) до O(d), что критически важно для больших моделей.

В экспериментах на контролируемых квадратичных задачах и реальных нейросетевых кривизнах предсказания ориентационно-разрешенной модели точно совпадали с фактическими переходами. Особенно явное преимущество наблюдалось, когда направление смещения играло важную роль. Сквозные эксперименты также показали резкие переходы при обучении на данных изображений и текста.

По словам авторов, предложенная формула и метод RaMaN могут стать практическим инструментом для выбора размерности латентного пространства без длительного перебора. Это потенциально ускоряет разработку эффективных методов тонкой настройки и оптимизации нейросетей.

Пока работа размещена в виде препринта и ещё не прошла полное рецензирование, но уже вызывает интерес у специалистов по оптимизации и машинному обучению.