Ученые нашли "общее пространство" в работе LLM при генерации текста: DecodeShare
Исследователи представили новый метод DecodeShare, позволяющий выявить общее низкоразмерное подпространство в скрытых состояниях больших языковых моделей (LLM) на этапе декодирования. Работа опубликована в архиве препринтов arXiv.
LLM демонстрируют впечатляющие результаты в широком круге задач, но оставалось неясным, существует ли общая структура, используемая моделью именно во время генерации текста, а не на этапе предварительной обработки запроса (префилла). DecodeShare направлен на исследование этого вопроса.
Метод идентифицирует подпространство, которое сохраняется при выполнении различных задач только в момент декодирования. В экспериментах удаление этого подпространства значительно сильнее ухудшало качество решений модели по сравнению с удалением подпространства, полученного на этапе префилла, или случайного подпространства при том же бюджете вмешательства.
Авторы также показали, что данное подпространство имеет практическое значение для активационного управления — распространённые направления такого управления могут пересекаться с общим каналом декодирования. Проецирование этого подпространства позволяет разделить функциональные роли разных компонентов.
Оценка управляющих векторов на этапе декодирования даёт более надёжный сигнал для последующего развёртывания, чем использование прокси на основе префилла. Несмотря на свою компактность, общее подпространство служит эффективным причинным каналом на этапе генерации.
Код алгоритма доступен на GitHub, что позволяет другим исследователям воспроизвести результаты и применить метод в своих работах. Открытие может упростить тонкую настройку больших языковых моделей и улучшить понимание их внутренней работы.
Работа представляет интерес для сообщества разработчиков ИИ, поскольку предлагает новый способ анализа и модификации поведения LLM без полного переобучения.



