LeanStream: фреймворк для LLM на устройствах ускорил вывод в 2 раза и сократил память в 7 раз

Группа разработчиков опубликовала на arXiv описание нового фреймворка LeanStream, предназначенного для ускорения инференса больших языковых моделей (LLM) непосредственно на устройствах. Работа вышла под идентификатором 2609.03079 и описывает подход, который позволяет обойти фундаментальное ограничение мобильных систем — нехватку оперативной памяти для хранения весов модели.

Как сообщается в аннотации, классические решения для on-device инференса опираются на разреженность активаций и выгрузку весов в SSD или флеш-память. Однако такие системы сталкиваются с дилеммой: точное разреженное исполнение требует самых свежих данных контекста, а эффективное перекрытие вычислений и ввода-вывода — раннего прогнозирования. Из-за этого существующие конструкции либо выполняют этапы последовательно, либо страдают от избыточной подгрузки весов, лишних вычислений и больших накладных расходов на кэш.

LeanStream решает эту проблему с помощью спекулятивно-уточняющего конвейера. Фреймворк постепенно уточняет приоритеты вычислений, загрузки и удержания в кэше, используя частичные результаты работы графического процессора. Это позволяет добиться мелкозернистого перекрытия между выполнением на GPU и операциями ввода-вывода с накопителем.

Авторы реализовали LeanStream как на мобильных, так и на встраиваемых платформах. По данным из аннотации, по сравнению с предыдущими системами on-device инференса LeanStream снижает потребление памяти в 4,8–7,5 раза при наилучшей пропускной способности, достигнутой более ранними работами. Дополнительно фреймворк увеличивает скорость генерации токенов в 1,6–2,1 раза.

Предложенный подход ориентирован на сценарии, где важны приватность и отзывчивость: обработка данных без отправки в облако и минимальная задержка. Использование флеш-памяти вместо DRAM для хранения весов — распространённый приём, но LeanStream делает его заметно более эффективным за счёт интеллектуального планирования.

Публикация носит технический характер и не содержит информации о коммерческом внедрении. Тем не менее, результаты указывают на возможность более комфортного запуска LLM на смартфонах, планшетах и встраиваемой электронике, где раньше это было сопряжено с серьёзными компромиссами между скоростью и объёмом памяти.