CAT-Flow: новый алгоритм сокращает число шагов генерации изображений на 40%
В основе современных генеративных моделей, таких как FLUX и Stable Diffusion 3.5, лежит Flow Matching. Этот подход показывает впечатляющие результаты, но требует 20–30 шагов для получения качественного изображения, что замедляет генерацию и увеличивает вычислительные затраты.
Команда исследователей предложила два новых алгоритма — CAT-OV и CAT-OT, которые автоматически подстраивают размер шагов во время инференса. Разработка основана на обнаруженной связи между процессом сэмплирования в Flow Matching и градиентным потоком.
CAT-OV оценивает кривизну траектории через конечные разности производной векторного поля по времени, а CAT-OT — через градиент поля в пространстве состояний. При этом алгоритмы не требуют дополнительных вызовов нейросети, что делает их крайне эффективными.
По данным arXiv, при определенных условиях оба метода имеют постоянные оценки ошибки усечения. На практике CAT-OV и CAT-OT превзошли существующие эвристики выбора шага в тестах на четырех моделях генерации изображений по текстовому описанию.
Авторы отмечают, что использование предложенных алгоритмов позволяет сократить число шагов, необходимых для достижения сравнимого качества, до 40%. Это может существенно ускорить работу сервисов, использующих генеративные модели.
Работа опубликована в открытом доступе, что позволяет разработчикам интегрировать CAT-Flow в свои пайплайны без дополнительного обучения моделей.



