论文

TrustMed-RL:用于循证临床诊断的长视野强化学习

TrustMed-RL: Long-Horizon Reinforcement Learning for Evidence-Grounded Clinical Diagnosis

模型训练智能体系统强化学习Agent任务评测Agentic RL长程任务评测

摘要

尽管调查不完整且推理不受支持,医学语言模型仍可以产生正确的诊断。为了支持长期的、基于证据的诊断,我们引入了 TrustMed-RL。它由 PubMed 罕见疾病病例和超过 24,000 个手动注释的图像面板构建而成,通过国家相关行动集成了访谈、检查、测试、专家咨询和文献检索。我们的 8B 视觉语言策略经过临床适应的 GiGPO 和覆盖范围调整的诊断奖励的训练,在 2,500 个评估案例中实现了 37.1% 的诊断准确性,优于所有评估的开放权重基线,并比监督的微调提高了 12.4 个百分点。当成功还需要获取至少 50% 的支持测试证据时,TrustMed-RL 实现了32.5%,比GPT-4o高出6.8个百分点。此外,它超越了 MTMedDialog 上的所有评估基线和 AgentClinic 上多个较大的 27--32B 模型。在医生对 200 个诊断上接受的测试集轨迹进行审查时,83.0% 的患者获得 4--5 分(满分 5 分)的证据支持分数。医生的评估表明这些诊断轨迹是值得信赖的,并且与人类诊断推理一致。

TrustMed-RL:用于循证临床诊断的长视野强化学习的原论文方法或结果图
图 2:训练框架。 (a) 教师模型生成的 SFT。 教师模型模型与环境交互以生成多轮咨询轨迹。来自 $\mathcal{D}_{\mathrm{SFT}}$ 的质量过滤轨迹;生成的 SFT 策略初始化 $\pi_{\theta}$ 并用作冻结的 KL 参考 $\pi_{\mathrm{ref}}$。 (b) 自适应 GiGPO。动态采样器结合了结果分散性、陈旧性和探索性,以选择交互课程承认的实例。每个实例在共享初始条件和预算下生成 $K$ 轨迹。集相关和步相关的优势共同指导策略优化。观察到的结果更新了抽样统计数据和入场估计,而分阶段的时间表则增加了整个优化步骤中的互动预算上限。