Новый метод Missing-Data Flow Matching решает проблему пропусков в данных для генеративных моделей

Научная работа, опубликованная на arXiv, предлагает новый метод обучения генеративных моделей на данных с пропусками. Стандартный подход Flow Matching требует полностью заполненных выборок, что редко встречается в реальных приложениях.

Авторы разработали метод Missing-Data Flow Matching, который рассматривает пропущенные координаты обучающих примеров как скрытые переменные. Вместо того чтобы отбрасывать неполные записи, алгоритм усредняет функцию потерь по всем возможным значениям пропусков.

Ключевой результат — математическое доказательство того, что такая коррекция является точной, а не приближённой. При условии случайного пропуска данных и корректного заполнения, целевая функция для неполных данных совпадает с функцией для полных данных. То есть пропуски не меняют суть обучения, а вся сложность переносится на модель заполнения.

Анализ конечных выборок даёт неожиданные ответы на практические вопросы. Оказывается, пропуски переносят дисперсию оценки, а не добавляют её. Одно заполнение на пример уже полностью соответствует дисперсии полных данных. При фиксированном бюджете вычислений одно заполнение является оптимальным.

Обученная модель заполнения вносит единственную неустранимую ошибку, которая ограничена ожидаемым условным расстоянием Вассерштейна до истинного распределения пропусков. Это позволяет формально оценить качество метода.

Эксперименты подтвердили теоретические выводы. Исследователи показали, что детерминированное заполнение, а не замороженная импутация, приводит к разрушению генерируемого распределения. На реальных табличных данных метод сравнился с сильными классическими и глубокими бейзлайнами.

Работа опубликована в разделе машинного обучения и доступна для ознакомления. Она может быть полезна специалистам, работающим с неполными данными в медицинских, финансовых и других прикладных областях.