Запись архива

GxP-Agent: как DAG-топология спасает LLM в клинических испытаниях

Мультиагентная система GxP-Agent кодирует процесс создания наборов данных для клинических испытаний в виде направленного ациклического графа (DAG). На бенчмарке CDISC-Bench система с Claude Sonnet 4.6 достигла 100% структурного совпадения — против 0% у всех одноагентных и плоских мультиагентных подходов.

Редакционная обложка COMRAD404: GxP-Agent: как DAG-топология спасает LLM в клинических испытаниях
Редакционная обложка COMRAD404: GxP-Agent: как DAG-топология спасает LLM в клинических испытаниях
Редакционная тематическая обложка COMRAD404

Что случилось

Исследователи представили GxP-Agent — мультиагентную систему для автоматизации программирования клинических испытаний. Проблема: LLM-генерация кода для преобразования протоколов исследований в наборы данных, совместимые со стандартами CDISC, терпит полный провал. В 11 однократных попытках с пятью современными моделями ни одна не создала валидный набор данных уровня субъекта.

Как работает GxP-Agent

Система кодирует регламентный порядок обработки как направленный ациклический граф (DAG). Монолитная генерация разбивается на 15 доменно-специфичных узлов, каждый из которых выполняется отдельным агентов с контекстом навыков pharmaverse, валидационными шлюзами и условными повторными попытками. Такая архитектура позволяет слабым моделям (например, GPT-4.1) достигать 59.2% структурного совпадения там, где они дают 0% в любой другой конфигурации.

Результаты на CDISC-Bench

Punkt Detail
Дата публикации 19 августа 2026
Бенчмарк CDISC-Bench (FDA пилот CDISCPilot01: 254 субъекта, 49 переменных ADSL)
GxP-Agent + Claude Sonnet 4.6 100% структурное совпадение (49/49 переменных, 254 корректные записи)
Лучший RAG-базлайн 2% структурного совпадения
Все одноагентные и плоские мультиагентные подходы 0%
Обобщение на ADAE 9-узловой DAG, 55 переменных, 1191 запись — 100% с первой попытки

Что это значит

Ключевой вывод: кодирование предметных знаний о процессе в виде топологии графа — а не полагание на рассуждения LLM — становится решающим фактором для надёжного, GxP-совместимого программирования клинических испытаний. Система показала стабильность на трёх независимых прогонах. Остаются вопросы: насколько метод обобщается на другие домены с жёсткой регуляторикой и как поведёт себя при масштабировании на реальные исследования с тысячами переменных.

Источники

Оригинальная статья: https://arxiv.org/abs/2608.16890
Верификационный лид: https://www.anthropic.com/news