论文
在生物医学工具宇宙上做治疗推理的AI智能体
An AI agent for treatment reasoning over a biomedical tool universe
摘要
治疗推理支撑每个治疗决策——整合疾病背景、合并症、用药、禁忌与演化的生物医学知识以选择合适疗法。它本质是迭代的:候选被多方约束权衡——随证据涌现而修订——并锚定于可验证来源。此处我们介绍ATHENA-R1——横跨1939年以来全部FDA批准药物的AI治疗推理智能体——经对212个生物医学工具宇宙的强化学习训练。每一步它识别缺失信息、选择并运行相关工具——并纳入证据。为在无人工标注踪迹下训练它——我们构建两级自学习框架:多智能体系统为监督微调构建工具、任务与推理轨迹——随后以科学反馈奖励推理质量(证据收集、锚定工具使用、逻辑非冗余)的强化学习。在含3,168个药物推理任务与456个患者治疗案例的五个基准上——ATHENA-R1超越语言模型与工具使用系统——开放式药物推理达94.7%准确率、治疗推理82.9%——分别超GPT-5 17.8与10.7分。在来自28个罕见病组织的专家盲评中——它在所有标准上被偏好于参照模型——医生对复杂住院心血管与感染病例评价良好。其生成的不良事件假设在540万患者电子健康记录中检验——达1.48-1.84的校正优势比——阴性对照中无升高。因为治疗推理要求在结论前知道要找什么证据——它长期是AI的难题;我们表明它可被重构为RL可训练的迭代证据收集可学习过程。
