LiNC: новый метод коррекции шумных меток повышает точность медицинского ИИ

Ошибки в разметке медицинских изображений — распространённая проблема, возникающая из-за различий между специалистами, неточностей аннотаций и сложных клинических случаев. Такие ошибки могут существенно снижать надёжность и клиническую эффективность моделей машинного обучения.

Для решения этой задачи группа исследователей предложила метод LiNC (Lightweight Noise Correction — лёгкая коррекция шума). Он добавляет обучаемый параметр доверия для каждого образца, который определяет, стоит ли использовать наблюдаемую метку или полагаться на предсказание модели во время стандартного обучения.

Ключевая идея — обучение с выпуклой комбинацией наблюдаемой метки и прогностического распределения самой модели, управляемой этим параметром. Градиент целевой функции приводит к противоположному изменению доверия для чистых и зашумленных образцов на ранней стадии обучения, что делает их распределения разделимыми.

После этого используется трёхкомпонентная гауссова смесь, которая разделяет образцы на чистые, неоднозначные и зашумленные. Для последних выполняется короткая фаза мягкой коррекции и финальная фаза жёсткой коррекции.

Эксперименты на десяти наборах данных MedMNISTv2 с уровнем шума до 50% показали стабильный прирост точности и высокую эффективность обнаружения неверных меток. При этом LiNC имеет почти нулевую добавочную вычислительную сложность: время обучения остаётся сопоставимым с базовой сетью, а дополнительные затраты памяти растут линейно с размером набора данных.

По мнению авторов, метод может быть полезен для повышения качества моделей в медицинской диагностике, где чистые размеченные данные редки и дороги. Открытый подход не требует серьёзной модификации существующих пайплайнов обучения.

Как отмечается в статье, LiNC решает важную задачу устойчивости ИИ к ошибкам разметки, что особенно актуально для внедрения алгоритмов в клиническую практику.