论文
TrialAtlas:用于临床试验设计和优化的多代理研究组织
TrialAtlas: Multi-Agent Research Organization for Clinical Trial Design and Optimization
摘要
尽管投入了数十亿美元,但近 90% 进入临床开发的药物最终还是失败了。因此,制药公司依靠临床开发规划(CDP)以及技术和监管成功概率评估来预测开发风险,但这些决策仍然是劳动密集型和主观性的,需要临床科学、统计、监管事务和竞争情报方面的专家共同获取、综合和推理异质证据。在这里,我们介绍 TrialAtlas,这是一个针对 CDP 的记忆增强多智能体研究组织,它通过协调专门的智能体进行文献合成、竞争性试验情报、监管先例分析以及试验设计和开发风险的综合推理来反映这一协作过程。 TrialAtlas 进一步从历史临床试验和监管结果(包括之前的新药申请 (NDAs))中学习,根据积累的开发经验做出决策。为了在真实的监管环境中评估这些能力,我们引入了 TrialAtlasBench,它由 291 封 FDA 完整回复函构建而成,涵盖三项实际任务:检测试验设计缺陷、建议可行的设计改进以及预测技术和监管成功。 TrialAtlas 在缺陷检测方面的 F1 得分为 50.0%,比最强基线高出 6.1 分,在技术和监管成功预测方面达到 85.3% 的平衡准确度和 84.7% F1,在平衡准确度方面比最佳基线高出 6.7 分,在 Cohen kappa 方面比最佳基线高出 12.0 分。在专家评估中,TrialAtlas 生成的问题中有 86.4% 被判定为有效,而 OpenAI DeepResearch 的这一比例为 83.1%,Gemini DeepResearch 的这一比例为 59.3%。