Новый метод PCS повышает точность управления большими языковыми моделями
Команда исследователей опубликовала в архиве препринтов arXiv работу, посвящённую новому подходу к управлению выводом больших языковых моделей (LLM). Предложенный метод получил название Probabilistic Concept-Aware Steering (PCS) и направлен на повышение интерпретируемости и точности вмешательств в процесс генерации текста.
Существующие методы steering vectors (SV) добавляют векторы направления к промежуточным активациям модели во время инференса, но часто страдают от несоответствий в представлениях, что снижает качество управления. Предыдущие работы в основном оценивали бинарную оппозицию положительного и отрицательного управления, используя метрики кластеризации, не учитывающие непрерывный спектр семантического выравнивания.
PCS решает эти ограничения. Фреймворк использует концептуальное извлечение векторов управления и вероятностную калибровку силы воздействия. Это позволяет сохранять исходную компетентность модели (точность на базовых задачах), одновременно обеспечивая заданный семантический сдвиг, например, в сторону большей безопасности или нейтральности.
Авторы подчёркивают, что PCS особенно актуален для сценариев, где требуется тонкая настройка поведения LLM без переобучения — например, для фильтрации нежелательного контента или адаптации к определённой стилистике. Метод не требует доступ к обучающим данным или дообучению, что делает его привлекательным для практического применения.
Эксперименты показали, что PCS обеспечивает более гладкое и контролируемое изменение семантических свойств генерируемого текста по сравнению с аналогами. Работа ещё не прошла рецензирование, но уже вызвала интерес в научном сообществе.


