论文
TxBench-PP:分析AI智能体在小分子临床前药理学上的表现
TxBench-PP: Analyzing AI Agent Performance on Small-Molecule Preclinical Pharmacology
摘要
人工智能(AI)智能体有望通过压缩解释与决策回路加速药物发现——但实际部署需要在真实项目决策上可信的评估。我们介绍治疗学基准临床前药理学(TxBench-PP)——可验证的小分子临床前药理学基准——也是横跨药物发现阶段与治疗模态的更大TherapeuticsBench努力的首个聚焦切片。TxBench-PP测试智能体能否从真实测定数据恢复准确结论——而非背诵文献记忆的事实。基准含100项评估——按项目阶段、测定类型与任务结构索引——横跨作用机制(MoA)与药效(PD)推理、化合物-靶点结合、因果靶点验证、可开发性与安全性及转化效力。智能体接收真实工作流快照——在编码环境中检查文件——返回确定性评分的结构化答案。跨16个模型-测试架配置(11个模型、4,800条轨迹)——没有任何系统可靠恢复临床前药理决策。最强配置Claude Opus 4.8/Pi通过59.3%的终点尝试(178/300;95% CI 51.1-67.6)——其次GPT-5.5/Pi为55.3%(166/300;47.0-63.6)。