论文
ResidencyRL:在模拟临床环境中用强化学习训练临床AI智能体
ResidencyRL: Reinforcement Learning in Simulated Clinical Environments
摘要
在医学教育中,医生通过住院医师训练将学术知识转化为临床专长:历经数年、数千次接诊的训练,反馈来源多样且自主权逐步扩大。大量临床推理依赖于患者接诊——一场对话,临床医生在其中询问病史、修正诊断假设,并在不确定性下决定处置方案。尽管大语言模型(LLM)在静态医学基准上表现出色,但优化完整临床决策序列的方法仍不成熟。我们提出ResidencyRL,一种通过模拟多轮临床接诊(每条轨迹最多60轮对话和8次工具调用)来训练临床人工智能(AI)智能体的强化学习(RL)方法。ResidencyRL将策略智能体与能够执行复杂对抗行为的LLM模拟器配对,针对与诊断准确性、处置质量、沟通、文档记录和安全性对齐的结构化奖励进行训练。在留出评估中,ResidencyRL智能体在对抗条件下将诊断准确率提升7.0%(88.0%对81.0%),并将危险信号漏检率降低31%,展示了对过早闭合(premature closure)的严格缓解。盲法专家临床医生验证了这些提升,在87.6%的并排比较中更偏好训练后的智能体。这些程序性能力可迁移到未见过的基准:该智能体在AMIE多次就诊基准的全部六个临床维度上超越基础模型,并在AgentClinic和CRAFT-MD上表现出一致方向的改进。我们的发现表明,序列性临床决策可以通过模拟中的多轮强化学习有效习得,产生稳健且可泛化的能力,为迈向临床精通铺平道路。要在真实世界工作流中确立临床实用性,仍需前瞻性验证。
