FPO: ускорение дообучения LLM в 3 раза без обратного распространения ошибки
Исследователи опубликовали на arXiv.org работу, в которой описали новый способ адаптации больших языковых моделей (LLM), получивший название Forward Pass Domain Adaptation (FPO). Метод позволяет дообучать модели без обратного распространения ошибки через тело нейросети, что существенно ускоряет процесс.
По данным статьи, FPO обеспечивает в 2,7–3,2 раза более высокую пропускную способность по сравнению со стандартным тонким тюнингом и снижает пиковое потребление памяти примерно на 40%. При этом показатели модели на задачах вне целевого домена остаются в пределах статистической погрешности от базовой версии, чего часто не удаётся добиться при полном обновлении весов.
Основная идея метода основана на эмпирическом наблюдении: на поздних слоях трансформера ошибка предсказания выходного слоя аппроксимирует истинный градиент с косинусным сходством 0,47–0,59. Это было проверено на шести публичных моделях. Авторы также предложили двухминутную диагностику, которая определяет для каждой модели слои, где такая аппроксимация работает лучше всего.
Сам процесс FPO вычисляет один сигнал ошибки на выходе и применяет его к целевым слоям, не передавая сигналы между слоями и не строя граф автодифференцирования. Это принципиально отличает метод от классического обучения.
Эксперименты проводились на трёх семействах моделей: OLMo-2-7B, Qwen3-8B и Falcon3-7B. Во всех случаях FPO улучшал перплексию на целевых данных и оставлял результаты на тестах MMLU, ARC-Challenge, HellaSwag и Winogrande в пределах шума базовой линии.
Авторы также проверили, можно ли добиться аналогичного режима, локализуя обычный SFT на целевые слои. Это оказалось возможно, но более чем вдвое медленнее: вычислительные затраты оказались в 2,2 раза выше, чем у FPO. Таким образом, предложенный подход выглядит более практичным для задач доменной адаптации.
Работа размещена в открытом доступе на arXiv под номером 2608.14563. Полный текст доступен для изучения исследователям и разработчикам, интересующимся эффективными методами дообучения языковых моделей.







