Сравнение четырех способов адаптации ИИ: эмиссия весов выигрывает по стоимости

Сравнение четырех способов адаптации ИИ: эмиссия весов выигрывает по стоимости

На arXiv появился препринт, авторы которого систематически сравнили четыре способа специализировать нейросеть под новую задачу, описанную всего несколькими примерами. В исследовании участвовали zero-shot, in-context attention, тест-тайм градиентная адаптация и эмиссия специализированных весов из гиперсети. Одинаковый протокол применили к шести задачам: регрессия, генерация, языковое моделирование, обучение с подкреплением, клиническая и геномная классификация.

Главный результат — эмиссия весов показывает лучшую стоимость при одинаковом качестве. На few-shot классификации в клинических данных модель с эмиссией сравнялась с современной амортизированной табличной моделью TabPFN. При этом вместо повторного просмотра опорного множества для каждого запроса она выдаёт готового специалиста. Для генерации форм достаточно программы из 132 чисел с плавающей запятой. На few-shot синусоидальной регрессии эмиссия оказалась на 2–3 порядка дешевле MAML при нулевом числе градиентных шагов, и разрыв сохранялся около 30 раз даже после выравнивания бюджета обучения.

Однако на высокоразмерном моделировании последовательностей эмиссия не смогла догнать in-context attention. При равных бюджетах предобучения одношаговый адаптер восстанавливал лишь 14% выигрыша от in-context на 5 миллионах параметров и 11,2% на 15 миллионах. Эксперименты с рангом LoRA показали, что это частичное ограничение ёмкости: доля восстановленного выигрыша росла с 5% до 21% при увеличении ранга, но оставалась далеко от полного восстановления.

Абляционные эксперименты подтвердили, что сгенерированный специалист действительно обусловлен задачей, а не является запомненным априорным распределением. Более того, авторы зафиксировали эффект композиции: интерполяция весов двух таких специалистов отслеживает смесь соответствующих функций. Это наблюдение названо предварительным и требует дальнейших проверок.

В заключение исследователи сформулировали проверяемую гипотезу: для каждой задачи можно ввести меру разрешения, которая предсказывает, какой из механизмов адаптации предпочтителен. Практическая значимость работы в том, что она помогает разработчикам выбирать стратегию настройки моделей в условиях ограниченных вычислительных ресурсов.