Новый метод сжатия промптов CAPC сокращает расходы на LLM API до 90% без потери качества
Исследователи из arXiv предложили новый метод оптимизации затрат на вызовы LLM API — Cache-Aware Prompt Compression (CAPC). Он решает проблему несовместимости существующих подходов к сжатию промптов с кэшированием, которое широко используется провайдерами для снижения стоимости повторного использования токенов.
В современных LLM API применяют два основных способа экономии: кэширование повторно используемых префиксов токенов (со скидкой) и сжатие самих промптов для уменьшения числа отправляемых токенов. Однако популярные query-aware методы сжатия создают уникальный сжатый префикс для каждого запроса, что делает кэш недействительным при каждом вызове. CAPC использует query-agnostic сжатие в паре с явным cache_control и ограничением на степень сжатия, чтобы не вытолкнуть префикс из более дешёвого холодного уровня кэша в горячий.
Эксперименты проводились на API Anthropic Sonnet 4.6. Выяснилось, что кэш Sonnet имеет двухуровневую архитектуру с резким порогом около 3500 токенов: ниже этого порога hit rate (доля попаданий в кэш) достигает лишь 0.83, а не идеального 1.0, как часто предполагают в литературе. CAPC оказался самой дешёвой стратегией во всех 16 конфигурациях бенчмарка LongBench-v2: средняя экономия составила 49% по сравнению с чистым кэшированием, 64% по сравнению с query-aware сжатием и 90% по сравнению с отправкой несжатых промптов. Качество ответов при этом ухудшилось не более чем на 0.05 от несжатого базового уровня.
Метод также проверили на трёх реальных сценариях. Для enterprise-инструмента с префиксом схемы в 94 тыс. токенов CAPC снизил стоимость на 51.7% при степени сжатия 3. В RAG-пайплайне для построения графа знаний по двум кодовым базам (FastAPI и httpx) CAPC оказался в 9,3 раза дешевле полного кэширования на FastAPI и в 2,4 раза дешевле на httpx. На публичном бенчмарке tau-bench retail (50 задач) CAPC стал самым дешёвым среди четырёх стратегий, а его награда (reward) оказалась равна эталонной — 36 из 50. Query-aware сжатие, напротив, оказалось самым дорогим (+40.1% к эталону), что подтвердило предсказания авторов о его отрицательной рентабельности.
Таким образом, CAPC предлагает практичное решение для компаний, использующих LLM в production: он сокращает расходы, не жертвуя качеством, и протестирован в реальных условиях. Авторы планируют дальнейшие исследования, в том числе для других API и архитектур кэша.




