Дизайн-данные: обучение с нуля с multi-crop догоняет ImageNet-претрейнинг
Научная работа, опубликованная на arXiv, посвящена сравнению стратегий обучения сверточных нейросетей (CNN) на специализированных данных в области дизайна и архитектуры. Авторы использовали датасет JONES-19, созданный на основе альбома The Grammar of Ornament (Лондон, 1857). Это небольшой набор изображений, который, в отличие от типичных компьютерных бенчмарков, передает эмпирические и формальные принципы дизайна.
Исследователи протестировали две стратегии: первая — классический претрейнинг на ImageNet, который дает моделям общее визуальное понимание, и вторая — обучение с нуля непосредственно на данных JONES-19. В рамках второй стратегии применялся метод повторной локальной выборки (multi-crop), когда модель обучается на множественных фрагментах изображений.
Результаты показали, что предварительное обучение на ImageNet действительно улучшает дискриминативные способности модели. Однако обучение с нуля с использованием multi-crop позволяет достичь сопоставимых результатов. Это означает, что для высокоструктурированных дизайн-данных локальные представления, извлеченные из самого набора, оказываются достаточной основой для обучения.
Авторы подчеркивают, что их находка ставит под сомнение необходимость использования массивных универсальных претрейнинговых моделей в специализированных дизайн-областях. Вместо этого более эффективным может быть тщательный отбор небольших, но качественных датасетов, которые отражают специфику конкретной дизайн-среды.
Выводы работы имеют практическое значение для исследователей и практиков, работающих с графическими данными в архитектуре, искусстве и промышленном дизайне. Они подсказывают, что инвестиции в курирование данных могут оказаться более оправданными, чем наращивание вычислительных ресурсов для обработки огромных массивов.



