Data-Centric Parallel: новый метод ускоряет обучение нейросетей на длинных последовательностях в 2,88 раза
Группа исследователей опубликовала на arXiv препринт, посвящённый проблеме обучения глубоких нейросетей на переменных длинных последовательностях. Новая методика под названием Data-Centric Parallel (DCP) предлагает передать управление процессом обучения самим данным, что позволяет существенно повысить эффективность распределённых вычислений.
Традиционные подходы вынуждают искать компромисс между простотой использования и производительностью. Простые решения используют статические конфигурации, что приводит к дисбалансу нагрузки и низкой эффективности. Сложные методы, наоборот, дают хорошую производительность, но требуют серьёзных изменений в коде и сложны для адаптации к новым моделям.
DCP решает эту задачу иначе: runtime сам изменяет ключевые параметры — такие как размер параллелизма, накопление градиентов и пересчёт — в зависимости от длины последовательности в каждом конкретном батче. Вместо того чтобы подгонять данные под фиксированную схему, система адаптируется к данным в реальном времени.
Эксперименты показали, что метод позволяет достичь ускорения до 2,88 раза при работе на 32 графических процессорах NVIDIA H200. Авторы подчёркивают, что DCP спроектирован для обобщения: интегрировать его можно в любую модель буквально десятью строками кода.
Эта работа может стать полезным инструментом для специалистов, работающих с длинными последовательностями — например, в обработке естественного языка, анализе временных рядов или биологии. Простота внедрения делает подход привлекательным в качестве базового решения для дальнейших исследований в области распределённого обучения.
Препринт доступен на платформе arXiv под номером 2608.07524, официальная публикация в рецензируемом журнале пока не состоялась.






