论文

ResidencyRL:在模拟临床环境中用强化学习训练临床AI智能体

ResidencyRL: Reinforcement Learning in Simulated Clinical Environments

模型训练强化学习Agentic RL

摘要

在医学教育中,医生通过住院医师训练将学术知识转化为临床专长:历经数年、数千次接诊的训练,反馈来源多样且自主权逐步扩大。大量临床推理依赖于患者接诊——一场对话,临床医生在其中询问病史、修正诊断假设,并在不确定性下决定处置方案。尽管大语言模型(LLM)在静态医学基准上表现出色,但优化完整临床决策序列的方法仍不成熟。我们提出ResidencyRL,一种通过模拟多轮临床接诊(每条轨迹最多60轮对话和8次工具调用)来训练临床人工智能(AI)智能体的强化学习(RL)方法。ResidencyRL将策略智能体与能够执行复杂对抗行为的LLM模拟器配对,针对与诊断准确性、处置质量、沟通、文档记录和安全性对齐的结构化奖励进行训练。在留出评估中,ResidencyRL智能体在对抗条件下将诊断准确率提升7.0%(88.0%对81.0%),并将危险信号漏检率降低31%,展示了对过早闭合(premature closure)的严格缓解。盲法专家临床医生验证了这些提升,在87.6%的并排比较中更偏好训练后的智能体。这些程序性能力可迁移到未见过的基准:该智能体在AMIE多次就诊基准的全部六个临床维度上超越基础模型,并在AgentClinic和CRAFT-MD上表现出一致方向的改进。我们的发现表明,序列性临床决策可以通过模拟中的多轮强化学习有效习得,产生稳健且可泛化的能力,为迈向临床精通铺平道路。要在真实世界工作流中确立临床实用性,仍需前瞻性验证。

ResidencyRL:在模拟临床环境中用强化学习训练临床AI智能体:论文配图
图1:通过模拟多轮患者接诊训练临床AI智能体。a,生成式提议者—评判者流程基于特定的人口学与行为患者画像合成并筛选多样化的临床场景。b,筛选后的场景被分层为专门的训练环境,包括常规远程问诊、需要深入病史采集的复杂病例,以及对抗性安全挑战,各自针对不同的临床能力。c,模拟环境提供一个LLM驱动的患者模拟器和结构化API,使智能体能够记录接诊内容(如诊断、管理方案)。d,多轮模拟rollout捕捉智能体序贯的临床推理、自然语言对话和工具使用,规模可达60轮对话和8次工具调用。e,LLM自动评分器处理接诊记录和工具调用,产生结构化奖励,其权重主要由临床准确性评分细则和关键安全标志决定。f,策略智能体通过Group Relative Policy Optimization(GRPO)利用并行rollout的奖励信号进行优化。g,在训练中优化诊断、管理、接诊、沟通、记录和风格(归一化至[0,1])。h,由专家临床医生(N=97)进行的并排评估表明,经ResidencyRL训练的智能体在所有评估的临床维度上均持续优于基础模型。