На arXiv представлен метод MAP, ускоряющий мультимодальные LLM в 3 раза
Мультимодальные большие языковые модели (MLLM) достигают высоких результатов в задачах, требующих одновременной обработки текста и изображений. Однако их практическое применение тормозит необходимость обрабатывать тысячи визуальных токенов на каждом шагу, что приводит к значительным вычислительным затратам.
Традиционный подход к решению этой проблемы — визуальное сокращение токенов (pruning), когда модель оставляет только самые важные элементы изображения. Ранее для этого использовались карты внимания из фиксированного среднего слоя языковой модели. Как показал анализ, такой выбор не всегда оптимален: слой, который лучше всего реагирует на вопрос, сильно меняется в зависимости от конкретного примера.
Дополнительная сложность в том, что получение внимания из среднего слоя требует прогнать все визуальные токены через несколько слоёв, а это уже отнимает большую часть вычислительного бюджета. Новый метод MAP, предложенный авторами препринта, решает обе проблемы.
MAP использует технику Question Contrastive Teacher Selection: для каждого входного примера он подбирает специфический слой-учитель, сравнивая внимание при исходном и эталонном вопросе. Затем внимание этого слоя дистиллируется в лёгкий предсказатель, который оценивает важность визуальных токенов уже по мультимодальным входным признакам.
Во время инференса MAP объединяет предсказанные оценки важности с критерием разнообразия и сокращает визуальные токены до того, как они попадут в первый слой языковой модели. Это означает, что для работы метода не нужны карты внимания, а сам он остаётся совместимым с другими техниками ускорения.
Эксперименты на модели LLaVA-NeXT-7B показали впечатляющие результаты: на десяти бенчмарках MAP сохраняет 97.5% производительности, используя лишь 5.56% визуальных токенов. Сквозное ускорение достигает 3.09 раза, что делает метод практичным инструментом для развертывания MLLM в реальных приложениях.
Предложенный подход открывает путь к более эффективным мультимодальным системам, особенно в условиях ограниченных вычислительных ресурсов. Дальнейшие исследования могут быть направлены на адаптацию MAP к другим архитектурам и расширение его совместимости с методами квантования и дистилляции.






