Новый метод FedPref улучшает ИИ-анализ радиологических отчетов, не раскрывая данные больниц

Радиологические отчеты описывают находки и локализации свободным текстом, но для поиска и анализа такие данные нужны в фиксированной схеме. Обучить модель извлечению этих данных сложно: разметка распределена между учреждениями неравномерно, у небольших больниц меньше локальных примеров, а объединение данных часто невозможно по регуляторным или практическим причинам.

Группа исследователей предложила метод FedPref, который решает эту задачу без передачи самих отчетов или аннотаций. Суть подхода: замороженные публичные языковые модели генерируют альтернативные варианты JSON-извлечения, локальные аннотации ранжируют эти варианты, а учреждения совместно обучают компактные адаптеры на базе Qwen3-8B, обмениваясь только обновлениями моделей.

Важная деталь — гетерогенный пул учителей. Он обеспечивает перекрестное разнообразие моделей, когда повторные сэмплы одной модели схлопываются. Это позволяет избежать однообразия и повышает устойчивость обучения.

В экспериментах на данных шести смоделированных больниц с неравным объемом данных и различиями в распространенности заболеваний FedPref улучшил средний F1 по клиентам на 2,49 пункта, а F1 худшего учреждения — на 9,10 пункта по сравнению с изолированным обучением каждой площадки. Наибольший выигрыш получили именно те учреждения, у которых было меньше всего данных.

Для сравнения: централизованное обучение на объединенном наборе пар предпочтений показало средний F1 на 2,66 пункта выше, чем FedPref. На закрытом тестовом наборе из 400 вручную проверенных отчетов FedPref достиг 68,68 F1, а объединенное обучение — 71,67, сохраняя ту же закономерность.

Таким образом, FedPref позволяет учреждениям с неравными и необъединяемыми данными получать выгоду от сотрудничества, не раскрывая при этом ни отчеты, ни аннотации. Это открывает возможности для более широкого применения федеративного обучения в медицинской сфере, где приватность данных критически важна.