Обучение с подкреплением сократило нарушения лимитов энергии при тренировке ИИ на 90%

Авторы нового исследования, опубликованного на arXiv, предложили использовать обучение с подкреплением для адаптивного управления энергопотреблением в дата-центрах при обучении больших языковых моделей. Работа описывает систему, которая в реальном времени корректирует параметры генерации модели, снижая нагрузку на GPU без потери производительности.

Современные дата-центры управляют мощностью с помощью статических лимитов и реактивного троттлинга, которые замедляют все оборудование одинаково. Это неэффективно, так как рабочие нагрузки вроде RL-пост-тренинга имеют свои пики и спады потребления. Авторы решили использовать телеметрию мощности с полусекундным интервалом и мета-контроллер на основе PPO, который адаптирует параметры генерации к измеренной мощности.

В экспериментах на 7B, 14B и 72B моделях на GPU A100 (более 380 тысяч сэмплов) контроллер на трассе из 500 шагов для 7B модели снизил нарушения лимитов мощности на 89,8%, увеличил выход токенов на 18,1% и повысил энергоэффективность на 26,2% (токены на МВт·ч). Однако при живой работе на 72B исходная версия показала нулевой результат: выяснилось, что механизм воздействия теряет контроль из-за шардирования модели.

Исследователи провели анализ и нашли, что те же параметры, применённые как параллелизм генерации, сохраняют 17–22% управляющей способности. Пересобранный контроллер на этой основе в живом тесте на 72B работе по генерации дал на 35,7% больше выходного результата, чем статический безопасный базовый уровень, при нарушениях бюджета 2,27±1,08% и на 87,2% меньше нарушений, чем при неуправляемой работе. Также он показал лучшую среднюю пропускную способность и энергию на токен среди ограниченных контроллеров.

Отдельно авторы изучили влияние окна измерения: кратковременные скачки потребления, которые видны при полусекундном опросе, почти исчезают на более длинных интервалах. Для 72B модели переходные процессы составили 23,6% на полусекундных замерах, 1,6% на 30-секундных и ноль на 5-минутных. Для кластера из 16 GPU нарушения полностью исчезают на окнах от 30 секунд, а пиковый спрос оказывается на уровне 50–56% от номинальной мощности.

По оценке авторов, для такого состава кластера допустима примерно двукратная избыточная подписка по мощности, но требуется проверка операторами. В работе также quantified экономические и углеродные последствия и предложен недорогой пилотный проект для операторов дата-центров. Исследование подчёркивает, что интеллектуальное управление энергией может стать ключевым инструментом в снижении затрат и экологического следа ИИ-инфраструктуры.