Meta-LoRA улучшает персонализацию LLM в незнакомых доменах: прирост до 110%

Научная группа представила на arXiv новый подход к персонализации больших языковых моделей (LLM) в условиях кросс-доменного нулевого и few-shot обучения. Разработка получила название Meta-LoRA и использует мета-обучение для настройки модели под предпочтения конкретного пользователя даже в тех сферах, где у модели нет исторических данных об этом пользователе.
Основная проблема, которую решают авторы, — переобучение при ограниченном числе взаимодействий. Стандартные методы адаптации с трудом подбирают величину обновления весов на основе небольшого набора примеров, а методы переноса истории часто смешивают пользовательские предпочтения с артефактами исходного домена. Это приводит к ненадежным приоритетам и негативному переносу.
Meta-LoRA предлагает использовать мета-обученную LoRA-инициализацию как в качестве отправной точки адаптации, так и в качестве центра предыдущего распределения. При этом сила обновления регулируется в зависимости от размера опорного набора и предсказательной неопределенности. Благодаря этому ограничивается переобучение при разреженных или неоднозначных данных, а при росте числа примеров персонализация усиливается.
Дополнительно авторы разделяют приоритеты персонализации на пользовательские и доменные компоненты. Стабильные предпочтения описываются через понятный человеку промпт, а для скрытого пространства домена применяются мягкие токены, сохраняющие топологию представлений. Такой декомпозиции помогает модели решить, какие предпочтения переносить между доменами и как их выражать.
Эксперименты на нескольких бенчмарках показали устойчивое превосходство над сильными базовыми линиями. На наборе данных HiCUPID новый метод снизил деградацию процента побед при кросс-доменном переносе на 47,9% относительно лучшей конкурирующей модели. В сценарии холодного старта с неизвестным пользователем улучшение win rate составило 110,2%.
Авторы отмечают, что разработанный подход может быть полезен для систем рекомендаций, виртуальных ассистентов и других продуктов, где требуется быстрая адаптация к предпочтениям пользователя без длительной истории общения. Полный текст исследования доступен на arXiv.




