Исследователи обобщили проблему коллапса ИИ-моделей из-за синтетических данных и способы борьбы

Генеративный искусственный интеллект (ИИ) достиг значительных успехов благодаря масштабным веб-данным, но для обучения новых моделей все чаще используются синтетические данные. Как отмечается в новой работе на arXiv, это создает скрытую угрозу: в замкнутом цикле обучения модель может постепенно деградировать.

Явление получило название model collapse (коллапс модели). Оно возникает, когда модель обучается на данных, которые сама же и генерирует. Со временем ошибки накапливаются, разнообразие выходных данных снижается, и качество модели ухудшается, что ставит под сомнение надежность генеративного ИИ.

Авторы обзора подчеркивают: синтетические данные помогают снять проблему нехватки реальных данных, но без понимания рисков их использования можно столкнуться с серьезной деградацией моделей. До сих пор, по их словам, не было комплексной сводки по этому явлению, и новая статья призвана заполнить пробел.

В работе рассматриваются случаи коллапса модели в различных сценариях применения генеративного ИИ, а также анализируются предлагаемые контрмеры. Исследователи систематизировали существующие подходы, которые могут смягчить негативные эффекты, однако конкретные методы в аннотации не раскрываются.

Авторы также выделили основные вызовы и перспективные направления для будущих исследований. По их мнению, эта область требует дальнейшего изучения, чтобы обеспечить стабильное и надежное развитие генеративных моделей в условиях все более широкого использования синтетических данных.

Проблема коллапса модели имеет прямое отношение к созданию новых поколений ИИ-систем, особенно в сферах, где данные ограничены. Новый обзор предоставляет исследователям и разработчикам базу для понимания рисков и поиска решений.