Новая теоретическая база ускорит федеративное обучение нейросетей
Международная группа исследователей опубликовала работу, посвящённую теоретическим основам распределённой и федеративной оптимизации. В диссертации рассматриваются семь ключевых проблем, возникающих при обучении больших моделей на распределённых системах.
Первым значимым результатом стал алгоритм ProxSkip. Его авторы математически доказали, что локальные шаги градиентного спуска способны ускорить коммуникацию между узлами. Ранее этот приём широко использовался на практике, но не имел строгого обоснования.
На основе ProxSkip разработана версия Variance Reduced ProxSkip. Она устраняет ошибку, возникающую из-за стохастических локальных обновлений, и позволяет точнее балансировать между объёмом вычислений и частотой связи.
Кроме того, учёные показали, что ускорение коммуникации сохраняется даже при частичном участии клиентов. Это важное свойство для реальных систем, где не все устройства могут одновременно подключиться к серверу.
Отдельное внимание уделено устойчивости к сбоям. Предложен метод, который одновременно обеспечивает защиту от византийских ошибок (когда отдельные узлы могут передавать некорректные данные) и поддерживает частичное участие клиентов. В основе метода — сокращение разностей градиентов.
Наконец, авторы разработали первую теоретическую основу для низкоранговой адаптации больших моделей. Этот подход, известный как LoRA, активно используется для тонкой настройки, но до сих пор не имел строгого математического анализа. Новая теория помогает понять, как работает такая адаптация и как её улучшить.
Все предложенные алгоритмы проверены в численных экспериментах. Результаты подтверждают, что они не только эффективнее существующих методов, но и работают в условиях, приближенных к реальным.




