ИИ в радиологии: почему плоских снимков недостаточно — обзор 200+ исследований

ИИ в радиологии: почему плоских снимков недостаточно — обзор 200+ исследований

В новом обзоре на платформе arXiv проанализировано более 200 научных работ по применению мультимодальных больших языковых моделей (MLLM) в радиологии. Авторы отмечают, что современные модели обычно работают с плоскими изображениями, сжатыми визуальными признаками или текстовыми отчётами, тогда как в реальной клинике часто нужна полная объёмная пространственная информация.

Такое ограничение особенно важно для диагностики, где требуется учитывать трёхмерные особенности органов и получать количественные данные, зависящие от условий съёмки. Как подчёркивается в обзоре, это создаёт разрыв между возможностями ИИ и требованиями клинической практики.

Авторы разделяют литературу на несколько уровней: модели объёмного представления и мультимодального понимания, агентные системы, которые расширяют возможности MLLM через планирование, инструменты, память и взаимодействие с рабочими процессами, а также связь этих технологий с клиническими приложениями.

В обзоре рассматриваются объёмные фундаментальные модели, стратегии выравнивания языка и сжатия данных. Исследователи выделяют сценарии, где достаточно выбранных 2D-срезов или анализа текстовых отчётов, и ситуации, требующие нативного объёмного моделирования.

Особое внимание уделяется методологии оценки. Представлена система Claim-Design-Validation, которая позволяет проверить, соответствуют ли заявленные технические, рабочие и клинические характеристики выбранной схеме эксперимента.

Авторы приходят к выводу, что выбор между плоскими и объёмными подходами зависит от пространственных, количественных, контекстных и процессных требований задачи. Для достоверности клинического применения необходимы точное представление объёмных данных, прослеживаемое поведение системы и чёткое распределение ответственности между человеком и ИИ.