Языковой контекст перекодирует визуальные признаки в моделях ИИ
Исследователи представили на arXiv работу, которая меняет представление о работе vision-language моделей (VLM). Вопреки распространенной точке зрения, визуальные представления в таких моделях не являются статичным хранилищем информации, а активно модулируются языком, поступающим на вход.
Авторы выделяют два конкретных механизма языковой перекодировки. Первый — абстрактные эталонные представления, которые определяют, какие объекты значимы для текущего запроса. С помощью контрастного обучения они извлекли управляющие векторы, соответствующие этим представлениям, и показали, что они напрямую влияют на предсказания модели.
Второй механизм — модуляция атрибутов. В поздних слоях сети избирательно усиливаются признаки, релевантные поставленной задаче. Например, если спросить о цвете, модель подчеркивает цветовые характеристики объектов, что подтверждено экспериментами с разными промптами.
Ключевая особенность найденных представлений — их абстрактность. Они работают для различных объектов, задач и даже при переходе от синтетических к естественным изображениям. Это говорит о том, что механизм является общим, а не заученным для конкретного набора данных.
Авторы также провели причинное вмешательство: изменяя модуляцию атрибутов, они напрямую влияли на распределение ответов модели. Это подтверждает, что перекодировка — не побочный эффект, а важная часть процесса рассуждения.
Результаты поддерживают более динамичную модель кросс-модальной обработки: визуальные токены не просто хранят информацию, а настраиваются под запрос, сформулированный на естественном языке. Это открывает новые перспективы для создания более интерпретируемых и управляемых систем ИИ.


