论文

MedExAgent:训练 LLM 代理在嘈杂的临床环境中进行询问、检查和诊断

MedExAgent: Training LLM Agents to Ask, Examine, and Diagnose in Noisy Clinical Environments

模型训练强化学习

摘要

现实世界的临床诊断是一个复杂的过程,医生需要从与患者的互动和进行医学检查中获取信息。此外,医生需要适应不同的患者角色,以及过程中随时可能发生的嘈杂和不完整的信息。然而,现有的医学LLM基准和自动诊断方法很大程度上简化了这一过程,将其简化为单轮问答、无噪音对话或顺序检查等,忽略了临床诊断的交互性和不确定性。在本文中,我们的目标是通过将临床诊断形式化为部分可观察马尔可夫决策过程(POMDP)来解决这一差距,该决策过程具有三种操作类型:询问患者、作为工具调用命令进行医疗检查以及发布诊断。我们还引入了一个系统噪声模型,包括七种患者噪声类型和三种检查噪声类型。使用我们提出的环境,我们通过两阶段管道训练有效的诊断代理 \textbf{MedExAgent},该管道首先对根据卡尔加里-剑桥临床访谈模型构建的合成对话进行监督微调,然后应用 DAPO 来优化复合奖励,捕获诊断准确性、工具调用质量和检查成本(包括财务成本和患者不适)。通过广泛的实验和消融研究,我们证明 MedExAgent 实现了与大型模型相当的诊断性能,同时保持了具有成本效益的检查策略。