LLM-агенты GxP-Agent достигли 100% точности в программировании клинических испытаний

Программирование клинических испытаний — превращение протоколов исследований в готовые для анализа наборы данных по стандартам CDISC — остается узким местом при подготовке регуляторных документов. Как показало новое исследование, опубликованное на arXiv, даже передовые языковые модели не справляются с этой задачей: в 11 одиночных попытках с участием пяти моделей ни одна не смогла создать валидный набор данных уровня субъекта.

В ответ на это команда разработчиков представила GxP-Agent — мультиагентную систему, которая кодирует нормативный порядок процессов в виде направленного ациклического графа (DAG). Вместо того чтобы генерировать весь массив данных за один раз, система разбивает работу на 15 специализированных узлов, каждый из которых выполняет отдельную задачу с контекстом фармацевтического инструментария pharmaverse, а также имеет проверочные шлюзы и механизм условных повторов.

Для оценки исследователи создали бенчмарк CDISC-Bench на основе пилотного набора данных FDA CDISCPilot01, включающего 254 субъекта и 49 эталонных переменных ADSL. GxP-Agent с моделью Claude Sonnet 4.6 показал 100% структурное соответствие (все 49 переменных, 254 корректные записи) в трех независимых запусках. Для сравнения, лучший подход с дополненной генерацией по базе знаний достиг лишь 59,2%, а все одиночные и плоские мультиагентные подходы — 0%.

Особенно примечательно, что графовая топология позволяет справляться с задачей и более слабым моделям. GPT-4.1 под управлением той же DAG-архитектуры достиг среднего структурного соответствия 59,2%, тогда как в любой другой конфигурации его результат составил 0%.

Метод также продемонстрировал обобщаемость на другой тип данных — ADAE (таблица нежелательных явлений) с разветвленным DAG из 9 узлов, 55 переменными и 1191 записями. Здесь система достигла 100% структурного соответствия с первой попытки.

По словам авторов, эти результаты свидетельствуют о том, что кодирование знаний о предметной области в виде графовой топологии — а не опора только на логические рассуждения LLM — является ключевым фактором для надежного и соответствующего правилам GxP программирования клинических испытаний.