Новый метод One Student, Many Teachers улучшает многозадачное обучение языковых моделей
В новой научной работе на arXiv описан метод One Student, Many Teachers (OSMT), который решает проблему многозадачного обучения больших языковых моделей. В отличие от классической дистилляции, здесь учитель отличается от студента только обучаемым мягким промптом (soft prompt), что сохраняет точное представление исходной модели.
Авторы предлагают подход on-policy self-distillation: учитель, имеющий ту же архитектуру, что и студент, обучается на золотых парах (x, y_gold) с замороженным бэкбоном. Это позволяет избежать накопления ошибок и забывания при последовательном обучении на нескольких задачах.
В многоучительском варианте (multi-task) каждый пример из объединённого корпуса направляется к своему промпт-учителю, и один студент параллельно впитывает знания от K учителей. На этапе инференса все промпты отбрасываются, что делает модель компактной.
Экспериментальное тестирование проводилось на моделях Qwen3-1.7B-Base и Phi-4-mini-instruct. В качестве задач использовались Science, Tool Use, Biology и Math. Одноучительский вариант (OPD с PT-учителем) показал результаты на уровне или выше полного fine-tuning, при этом обучалось на порядок меньше параметров.
Многоучительский вариант достиг лучшего среднего показателя 56,2 на Qwen3-1.7B-Base. При этом общие способности модели (general-capability benchmarks) не ухудшились, в отличие от последовательного SFT, который ведёт к деградации.
Метод может быть полезен для разработки более эффективных и универсальных языковых моделей, особенно в условиях ограниченных вычислительных ресурсов. Исходный код и веса в работе не приведены, но авторы планируют открыть реализацию.





