Knowledge-centric агенты улучшают генерацию workflow в визуальных системах
Генерация рабочих процессов (workflow) в визуальных системах, таких как ComfyUI, требует не только синтаксической точности, но и экспертных знаний на уровне модульных композиций. Существующие подходы на основе больших языковых моделей (LLM) часто рассматривают это как прямую задачу генерации текста в JSON, что приводит к структурной хрупкости и нехватке опытных знаний.
Новая работа, опубликованная на arXiv (2607.15845), предлагает knowledge-centric фреймворк, который учится инвертировать, внедрять и использовать знания на нескольких уровнях абстракции. Исследователи утверждают, что успешная генерация workflow требует моделирования самого знания, включая его структуру, иерархию и динамику рассуждений.
Метод включает три этапа. Первый — инверсия знаний: из больших коллекций реальных рабочих процессов извлекаются иерархические представления — от полных псевдокодов и скелетов до высокоуровневых стратегий. Второй — инъекция знаний через контролируемую тонкую настройку модели для рассуждения от описания задачи к стратегии и от стратегии к исполняемой структуре.
На этапе вывода модель выполняет обратимое рассуждение для синтеза исполняемых workflow, дополненное самоуточнением для структурной согласованности. Эксперименты показали, что такой подход создаёт workflow с более разнообразными узлами, более связной структурой и более высокой успешностью выполнения по сравнению с существующими системами.
Разработка закладывает новую основу для управляемой знаниями агентной генерации workflow, что может существенно упростить работу дизайнеров и разработчиков в визуальных средах, где требуется сложная логика модулей.


