论文

GxP-Agent:用过程DAG拓扑实现可靠的LLM Agent临床试验编程

GxP-Agent: Process-DAG Topology for Reliable Clinical Trial Programming with LLM Agents

智能体系统Agent Harness

摘要

临床试验编程——在CDISC标准下将研究方案转换为可供分析的数据集——是监管申报中的一个瓶颈,而基于LLM的代码生成在此任务上会灾难性失败:在使用五个前沿模型的11次单次尝试中,没有一个能生成有效的受试者级分析数据集。我们提出GxP-Agent,一个将监管流程顺序编码为有向无环图(DAG)的多Agent系统,将单体式数据集生成分解为15个由具备pharmaverse技能上下文、验证门和条件重试的worker Agent执行的领域特定节点。在CDISC-Bench上——一个基于FDA试点提交CDISCPilot01(254名受试者,49个真实ADSL变量)构建的新的基于执行的基准——配备Claude Sonnet 4.6的GxP-Agent在三次独立运行中达到100%结构匹配(49/49变量,254条正确记录),相比之下最佳检索增强基线为59.2%,所有单Agent和扁平多Agent方法为0%。DAG拓扑还能让较弱的模型发挥作用:GPT-4.1在同一DAG下达到59.2%平均结构匹配,而它在其他所有架构下均为0%。该方法可泛化到ADAE(不良事件;9节点分支DAG,55个变量,1,191条记录),首次尝试即达到100%结构匹配。这些结果表明,将领域流程知识编码为图拓扑——而非仅依赖LLM推理——是实现可靠、符合GxP的临床试验编程的关键使能因素。