Бенчмарк конфиденциального вывода на NVIDIA H100: задержки выросли до 28%, пропускная способность упала на 21%

Авторы препринта на arXiv провели бенчмарк производительности конфиденциального вывода больших языковых моделей на одном графическом ускорителе NVIDIA H100 80 ГБ в конфиденциальном экземпляре Intel TDX. Работа призвана оценить практические затраты на включение безопасного режима для рабочих нагрузок ИИ.

Конфиденциальные вычисления становятся стандартным требованием для вывода нейросетей, обрабатывающих чувствительные данные или защищающих собственные модели. Однако плата за такую безопасность — снижение скорости — зависит от сценария и может быть критичной.

В качестве тестовых моделей выбраны Mistral-7B v0.1 (7 млрд параметров) и Qwen3-30B-A3B (30 млрд, с активными 3 млрд). Измерялись время до первого токена (TTFT), сквозная задержка запроса, пропускная способность генерации токенов, глобальная пропускная способность и пропускная способность в замкнутом цикле при растущей конкурентности запросов.

Результаты: в экспериментах с фиксированной частотой запросов конфиденциальный режим увеличил среднее TTFT на 21,8% для Mistral-7B и на 27,8% для Qwen3-30B-A3B. Глобальная пропускная способность токенов снизилась на 17,7% и 21,1% соответственно.

В тестах с замкнутым циклом и нарастающей конкурентностью разница в пропускной способности составила 11,5–20,2%. При этом более крупная модель (Qwen) достигала насыщения раньше в конфиденциальном режиме.

Авторы заключают, что конфиденциальный вывод на GPU может сохранять приемлемую пропускную способность под нагрузкой, но при планировании мощностей нужно учитывать как постоянную потерю производительности, так и более раннее насыщение для больших моделей.