Новый бенчмарк EarlyDx: ИИ пока не готов к ранней диагностике в приемном покое

Постановка диагноза при поступлении пациента в больницу — одна из самых сложных задач для ИИ. В распоряжении системы лишь ограниченные данные, а времени на размышления практически нет. Существующие бенчмарки для проверки таких систем устроены иначе: они используют коды диагнозов, игнорируют свободные тексты врачей и оценивают результат по выписным диагнозам, которые учитывают весь период госпитализации. Это не соответствует реальной клинической практике.

Исследователи представили новый бенчмарк EarlyDx, построенный на базе 154 834 обращений в отделения неотложной помощи из набора данных MIMIC-IV. Каждое обращение ограничено только той информацией, которая доступна на момент поступления пациента ($t_0$). В качестве эталонных ответов используются диагнозы, поставленные непосредственно во время приема, а не при выписке. Это делает задачу максимально приближенной к условиям реальной работы врача.

Для проверки корректности свободных текстовых ответов исследователи применили LLM-аудитор, который оценивает каждый сгенерированный диагноз как полностью подтвержденный, частично подтвержденный или неподтвержденный имеющимися данными. Основной метрикой качества считается точность только для полностью подтвержденных диагнозов.

Результаты оценки оказались показательными. Ни одна из протестированных систем — ни универсальные фронтальные модели, ни специализированные медицинские, ни дообученные на клинических данных — не смогла надежно синтезировать информацию из данных, доступных при поступлении. Zero-shot модели в основном просто извлекали факты из записи, демонстрируя лишь 3–31% диагностических выводов, которые требовали логического построения, а не прямого прочтения.

Дообучение на целевых данных улучшило ситуацию: recall для диагнозов, требующих логического вывода, вырос до 56%. Однако значительный разрыв сохраняется. Особую тревогу вызывают состояния, требующие быстрого вмешательства: ни одна система не достигла баланса чувствительности и точности, характерного для практикующего врача.

Авторы подчеркивают, что EarlyDx — это не просто очередной тест, а инструмент для разработки более надежных моделей ранней диагностики. Полный конвейер построения и оценки данных опубликован в открытом доступе, что позволяет другим исследовательским группам воспроизвести результаты и предложить новые подходы к решению проблемы.