Мета-обучение промптов не переносится между пользователями: эксперимент с LLM
Персонализация замороженных больших языковых моделей (LLM) часто рассматривается как задача мета-обучения в пространстве промптов. В такой постановке каждый пользователь считается отдельной задачей, а модель должна научиться адаптации по нескольким примерам взаимодействия. Однако новое исследование из архива препринтов arXiv (2609.01615) ставит под сомнение, что такой подход действительно обучается переносимым стратегиям.
Авторы представили метод Muse (Meta-learned User-adaptation via Shared Evolution), который развивает единый общий промпт на группе пользователей из обучающего набора, а затем применяет его без дообучения к новым пользователям. Для контроля использовались специальные условия, отделяющие реальное обучение от эффектов формулировок и выбора примеров.
Эксперименты проводились на двух стандартных наборах данных для персонализации: LaMP-2 (категоризация) и LaMP-3 (рейтингование). Для каждого набора были взяты 200 тестовых пользователей. Результаты показали, что Muse не дает значимого улучшения по сравнению с собственным неэволюционировавшим стартовым промптом и даже по сравнению с контрольным условием, где обучение выполнялось на несоответствующих парах пользователь-пример.
На задаче рейтингования Muse уступил простому few-shot подходу, основанному на поиске похожих примеров: средняя абсолютная ошибка выросла на 0,175 (p < 0,001). Это означает, что универсальный адаптационный промпт оказался менее эффективным, чем прямое использование нескольких релевантных примеров без какого-либо мета-обучения.
Авторы связывают неудачу с явлением, которое они назвали «коллапсом мета-цели». Суть в том, что мета-валидационная функция оказывается статистически инвариантной к тому, являются ли пары пользователь-поддержка реальными или перемешанными. На LaMP-2 уровень значимости p=0,555, на LaMP-3 — p=0,622, то есть никакой разницы не обнаруживается.
Из-за этого алгоритм не может оптимизировать переносимую адаптацию и вместо этого «вылизывает» формулировки и подстраивается под валидационный набор. Таким образом, совместно эволюционирующий промпт не кодирует никакой информации о конкретных пользователях, а лишь улучшает общее качество инструкции.
Исследование предлагает повторяемый протокол с контрольными условиями: стартовый промпт, неверные пары поддержки и «оракул инвариантности». Этот протокол позволяет отделить настоящее обучение от ложных эффектов. Результаты подчеркивают необходимость более строгой проверки утверждений о персонализации LLM через мета-обучение в пространстве промптов.



