Математики предложили оптимальный способ выбора уровней шума для диффузионных моделей

Диффузионные модели стали одним из основных инструментов генеративного ИИ, но выбор того, как распределять шум при обучении, до сих пор оставался областью эмпирических настроек. Новая научная работа, опубликованная на arXiv, предлагает математически обоснованный подход к этой задаче.

Авторы разработали статистический фреймворк для изучения асимптотически оптимального распределения уровней шума. В первой части работы они показали, что в полностью связанном режиме при определенных условиях выпуклости оптимизированный график обучения допускает атомарный минимизатор — сосредоточенный на конечном наборе уровней шума.

Вторая часть исследования посвящена модели «независимых обучающихся», имитирующей временную специализацию в нейросетях. Используя теорию случайных матриц, авторы вывели информационно-теоретический прокси: плотность распределения выборки пропорциональна квадратному корню из скорости генеративной энтропии — темпа роста условной энтропии вдоль прямого процесса.

Эксперименты на контролируемых настройках (смеси Дирака, низкоразмерные многообразия, MNIST) подтвердили теоретические выводы. Оптимизированные графики последовательно имели конечную опору, а гладкий энтропийный прокси хорошо совпадал с атомарным оптимумом в нейросетевых моделях, разрушаясь лишь в полностью связанном параметрическом случае.

На более крупных экспериментах, где полная оптимизация графика пока невыполнима, авторы оценили энтропийный график. Результаты показывают, что квадратично-корневое энтропийное планирование может существенно повысить эффективность обучения на дискретных доменах и остается конкурентоспособным со стандартными эвристиками EDM на непрерывных изображениях.

Это исследование открывает путь к более научно обоснованному выбору гиперпараметров в диффузионных моделях, что потенциально может ускорить их обучение и улучшить качество генерации.