LLM-поиск сократил параметры нейросети в 14 раз, повысив точность

LLM-поиск сократил параметры нейросети в 14 раз, повысив точность

Команда исследователей представила результаты масштабирования метода автоматического поиска ширины каналов нейронной сети, основанного на больших языковых моделях (LLM). В предыдущей работе LLM генерировала исполняемый код конфигурации, а обратная связь по точности использовалась для дообучения. Теперь эксперимент расширен: до 250 кандидатов на цикл.

Всего было проанализировано 2000 сгенерированных конфигураций из 8 полных циклов. После фильтрации удалось провести 462 валидных оценки на наборе данных CIFAR-100. Средняя точность за цикл показала положительный линейный тренд с наклоном 9,87e-4 (p=0,043). Лучшая точность выросла с 0,3144 до 0,3676 — прирост около 17%.

Ещё более впечатляющим оказалось сокращение числа параметров. Лучшая модель достигла точности 0,3676 всего с 11,8 млн параметров. Для сравнения: более ранняя модель с близкой точностью 0,3144 использовала 166,5 млн параметров — в 14 раз больше. Это демонстрирует, что LLM-поиск способен находить не только точные, но и параметроэффективные архитектуры.

Увеличенная выборка также позволила выявить закономерности в архитектурах, которые ранее было трудно заметить. В 41,8% проверенных кандидатов встречаются нестепенные двойке ширины каналов. Самые сильные модели демонстрируют структурированное распределение каналов: умеренная ширина на ранних слоях и расширение в средних или поздних блоках.

Эти результаты подтверждают, что сигнал поиска каналов, обнаруженный в первом исследовании, сохраняется и при более плотной выборке. Применение LLM для автоматической настройки архитектуры нейросетей может существенно ускорить процесс разработки эффективных моделей, особенно в условиях ограниченных вычислительных ресурсов.