论文

在生物医学工具宇宙上做治疗推理的AI智能体

An AI agent for treatment reasoning over a biomedical tool universe

智能体系统模型训练强化学习Agent 工具调用Agentic RL

摘要

治疗推理支撑每个治疗决策——整合疾病背景、合并症、用药、禁忌与演化的生物医学知识以选择合适疗法。它本质是迭代的:候选被多方约束权衡——随证据涌现而修订——并锚定于可验证来源。此处我们介绍ATHENA-R1——横跨1939年以来全部FDA批准药物的AI治疗推理智能体——经对212个生物医学工具宇宙的强化学习训练。每一步它识别缺失信息、选择并运行相关工具——并纳入证据。为在无人工标注踪迹下训练它——我们构建两级自学习框架:多智能体系统为监督微调构建工具、任务与推理轨迹——随后以科学反馈奖励推理质量(证据收集、锚定工具使用、逻辑非冗余)的强化学习。在含3,168个药物推理任务与456个患者治疗案例的五个基准上——ATHENA-R1超越语言模型与工具使用系统——开放式药物推理达94.7%准确率、治疗推理82.9%——分别超GPT-5 17.8与10.7分。在来自28个罕见病组织的专家盲评中——它在所有标准上被偏好于参照模型——医生对复杂住院心血管与感染病例评价良好。其生成的不良事件假设在540万患者电子健康记录中检验——达1.48-1.84的校正优势比——阴性对照中无升高。因为治疗推理要求在结论前知道要找什么证据——它长期是AI的难题;我们表明它可被重构为RL可训练的迭代证据收集可学习过程。

在生物医学工具宇宙上做治疗推理的AI智能体:论文配图
图 1:通过从生物医学工具领域检索和分析医学证据来精确治疗推理问题。对于患者治疗场景,对治疗建议以及记录证据检索、工具使用和中间分析的推理轨迹进行评分。该示例展示了一名患有 2 型糖尿病和早期慢性肾病 (eGFR 52 mL/min) 的 77 岁男性接受二甲双胍、ACE 抑制剂和氢氯噻嗪的蜇刺疗法。绿色节点表示人类输入和临床医生的感叹,蓝色节点表示推理步骤,橙色节点表示检索生物医学证据的工具调用。不遵循固定的操作顺序。它根据先前步骤中收集的信息自适应地确定要收集哪些证据、要执行哪些分析以及哪些问题需要进一步调查。在此示例中,并行评估 ACE 抑制剂、氢氯噻嗪和替代治疗方案,消除未经支持的假设(此处,钙通道阻滞剂显示与二甲双胍没有相互作用),并综合了剩余的证据。临床医生的感叹(“在此 eGFR 下,乳酸性酸中毒风险是否显着?”)会触发额外的证据收集和分析,然后再评估其最终建议。从单个蓝色节点分支出的多个橙色节点表示一个推理步骤内的并行工具调用。单独的推理分支表明不同治疗考虑因素的并发分析。这种适应性过程允许在评估治疗方案时整合患者特征、药物、禁忌症和生物医学证据。