Доказана экспоненциальная иерархия глубины ReLU-сетей: каждый слой экономит нейроны

Исследователи представили на arXiv доказательство новой теоремы о глубине нейронных сетей с ReLU-активацией. Работа устанавливает иерархию, в которой каждый дополнительный слой позволяет экспоненциально сократить количество нейронов.
Авторы показали, что для любой глубины l от 3 и выше существует функция, которую можно реализовать сетью глубины l и ширины порядка O(d^4), где d — размерность входа. При этом любая сеть глубины l-1 с шириной, не превосходящей 2^d/(2d(l-2)), имеет среднеквадратичную ошибку не менее 1/24 при некотором абсолютно непрерывном распределении.
По данным препринта, это первый результат, который даёт экспоненциальное разделение между двумя фиксированными глубинами, где меньшая глубина не меньше трёх. Также впервые построена экспоненциальная иерархия для всех соседних фиксированных глубин.
Отдельно рассмотрен случай глубины 3 против глубины 2. Он даёт компактно поддерживаемое разделение с неограниченными весами в мелкой сети. По словам авторов, это отвечает на вопрос, поставленный Сафраном, Элданом и Шамиром в 2019 году.
Впрочем, авторы отмечают, что для этого случая распределение сосредоточено на экспоненциальном радиусе, поэтому конструкция не попадает в регулярную область, где такое разделение повлекло бы серьёзные нижние оценки для схем малой глубины.
Кроме того, доказано точное разделение для более простой функции. Она вычисляется сетью глубины 4 с полиномиальной шириной, но любая сеть глубины 3, совпадающая с ней на единичном гиперкубе, требует экспоненциального числа нейронов в первом скрытом слое. При этом функция принимает значения от 0 до 1 и является липшицевой с константой порядка корня из d.
Полный текст доступен в архиве arXiv под идентификатором 2608.23877.




