
Что случилось
Исследователи представили GxP-Agent — мультиагентную систему для автоматизации программирования клинических испытаний. Проблема: LLM-генерация кода для преобразования протоколов исследований в наборы данных, совместимые со стандартами CDISC, терпит полный провал. В 11 однократных попытках с пятью современными моделями ни одна не создала валидный набор данных уровня субъекта.
Как работает GxP-Agent
Система кодирует регламентный порядок обработки как направленный ациклический граф (DAG). Монолитная генерация разбивается на 15 доменно-специфичных узлов, каждый из которых выполняется отдельным агентов с контекстом навыков pharmaverse, валидационными шлюзами и условными повторными попытками. Такая архитектура позволяет слабым моделям (например, GPT-4.1) достигать 59.2% структурного совпадения там, где они дают 0% в любой другой конфигурации.
Результаты на CDISC-Bench
| Punkt | Detail |
|---|---|
| Дата публикации | 19 августа 2026 |
| Бенчмарк | CDISC-Bench (FDA пилот CDISCPilot01: 254 субъекта, 49 переменных ADSL) |
| GxP-Agent + Claude Sonnet 4.6 | 100% структурное совпадение (49/49 переменных, 254 корректные записи) |
| Лучший RAG-базлайн | 2% структурного совпадения |
| Все одноагентные и плоские мультиагентные подходы | 0% |
| Обобщение на ADAE | 9-узловой DAG, 55 переменных, 1191 запись — 100% с первой попытки |
Что это значит
Ключевой вывод: кодирование предметных знаний о процессе в виде топологии графа — а не полагание на рассуждения LLM — становится решающим фактором для надёжного, GxP-совместимого программирования клинических испытаний. Система показала стабильность на трёх независимых прогонах. Остаются вопросы: насколько метод обобщается на другие домены с жёсткой регуляторикой и как поведёт себя при масштабировании на реальные исследования с тысячами переменных.
Источники
Оригинальная статья: https://arxiv.org/abs/2608.16890
Верификационный лид: https://www.anthropic.com/news
