Энергоэффективность локальных LLM: бенчмарк на RTX 4060 Ti выявил лидеров
Исследователи представили результаты замеров энергопотребления при локальном запуске больших языковых моделей на потребительской видеокарте. В ходе эксперимента сравнивались девять открытых LLM с числом параметров от 1 до 7 миллиардов, работающих на GPU RTX 4060 Ti с 16 ГБ памяти.
Актуальность работы связана с ростом интереса к локальному развертыванию нейросетей: пользователи все чаще выбирают такую схему ради приватности данных и автономности. Однако до сих пор энергетические затраты на обычном оборудовании оставались плохо изученными — большинство бенчмарков оценивают только точность.
В качестве движка использовался Ollama. Потребление фиксировалось через nvidia-smi с частотой 2 Гц на фиксированном наборе промптов. Авторы измеряли среднюю и пиковую мощность, общую энергию на запрос, энергию на токен и пропускную способность.
Главный вывод: эффективность определяется не только размером модели, но и архитектурой и стратегией квантования. Так, gemma3:1b и llama3.2:1b показали наилучшие результаты — около 0,56 и 0,65 джоуля на токен соответственно, а скорость превысила 170 токенов в секунду.
В то же время 7-миллиардная модель Mistral потребляла примерно в 4,4 раза больше энергии на токен, чем самая экономичная. Это подтверждает, что выбор архитектуры является ключевым фактором при локальной эксплуатации.
Отдельно отмечена аномалия qwen3.5:2b: у нее необычно высокие затраты энергии на запрос из-за продолжительных внутренних рассуждений. Авторы указывают, что в метриках эффективности важно разделять режимы генерации токенов.
Результаты могут помочь разработчикам и энтузиастам более осознанно подходить к выбору локальных моделей, учитывая не только качество ответов, но и реальные энергозатраты на обычном железе.







