JouleShare: новый метод точного учёта энергии запросов в LLM-серверах

Группа исследователей опубликовала на arXiv работу, посвящённую точному учёту энергозатрат при пакетном обслуживании больших языковых моделей (LLM). Предложенный фреймворк JouleShare решает давнюю проблему: стандартные телеметрические данные GPU отражают только суммарное потребление, но не разбивку по отдельным запросам.

Пакетная обработка повышает производительность серверов, но делает энергоучёт крайне сложным. Предыдущие исследования ограничивались оценками на уровне модели, фазы или токена, тогда как для отчётности по устойчивому развитию, внутренних расчётов и анализа нагрузки нужна точная стоимость каждого запроса. В работе впервые представлены измеренные эталонные значения для запросов, а не только теоретические модели.

Метод JouleShare состоит из двух компонентов. Офлайн-стенд воспроизводит обработку подмножеств запросов в среде vLLM, интегрирует показатели энергопотребления GPU и вычисляет точное значение Шепли для каждого запроса. Вторая часть — лёгкая калибровочная модель JCalib, которая обучается предсказывать доли Шепли на основе дешёвых характеристик запроса в реальном времени.

В экспериментах на 16 комбинациях моделей и рабочих нагрузок токен-пропорциональная атрибуция отклонялась от точного значения Шепли в среднем на 0.440 (статическая пакетная обработка) и 0.458 (динамическая). JCalib снизила эти ошибки до 0.116 и 0.177 соответственно, что даже лучше результатов автономных измерений, недоступных в реальной эксплуатации. При этом эффективность пакетной обработки сохраняется полностью.

Работа также показывает, что выборка Шепли позволяет расширить измеренные эталонные значения на большие группы. Разрыв между простыми правилами и справедливой атрибуцией сохраняется, а одиночная офлайн-калибровка остаётся самой точной применимой стратегией. Авторы подчёркивают: учёт энергии по токенам не является надёжным показателем предельных затрат в пакетном режиме.

Практическая значимость JouleShare очевидна для операторов дата-центров, облачных провайдеров и всех, кто стремится к объективной оценке углеродного следа ИИ-систем. Возможность приписать энергию конкретным запросам открывает путь к более честным тарифам и целенаправленной оптимизации.