论文
TrustMed-RL:用于循证临床诊断的长视野强化学习
TrustMed-RL: Long-Horizon Reinforcement Learning for Evidence-Grounded Clinical Diagnosis
摘要
尽管调查不完整且推理不受支持,医学语言模型仍可以产生正确的诊断。为了支持长期的、基于证据的诊断,我们引入了 TrustMed-RL。它由 PubMed 罕见疾病病例和超过 24,000 个手动注释的图像面板构建而成,通过国家相关行动集成了访谈、检查、测试、专家咨询和文献检索。我们的 8B 视觉语言策略经过临床适应的 GiGPO 和覆盖范围调整的诊断奖励的训练,在 2,500 个评估案例中实现了 37.1% 的诊断准确性,优于所有评估的开放权重基线,并比监督的微调提高了 12.4 个百分点。当成功还需要获取至少 50% 的支持测试证据时,TrustMed-RL 实现了32.5%,比GPT-4o高出6.8个百分点。此外,它超越了 MTMedDialog 上的所有评估基线和 AgentClinic 上多个较大的 27--32B 模型。在医生对 200 个诊断上接受的测试集轨迹进行审查时,83.0% 的患者获得 4--5 分(满分 5 分)的证据支持分数。医生的评估表明这些诊断轨迹是值得信赖的,并且与人类诊断推理一致。
