论文

面向医疗代理人的医疗保健 AI GYM

Healthcare AI GYM for Medical Agents

模型评测基准与评测资源

摘要

临床推理需要多步骤交互——收集患者病史、安排测试、解释结果和做出安全的治疗决策——然而,统一的训练环境提供了广泛的临床领域和专门工具,通过强化学习来训练通用的医疗人工智能代理仍然难以实现。我们提出了针对医疗 AI 的多轮代理 RL 的全面实证研究,该研究建立在 \gym{} 之上,这是一个跨越 10 个临床领域的健身房兼容环境,包含 3.6K 以上的任务、135 个特定领域的工具以及 828K 医学段落的知识库。我们的分析表明,主体多轮结构退化为冗长的单轮独白,其特征是单调长度爆炸和工具使用频率的同时侵蚀。我们描述了这种崩溃以及 蒸馏 不稳定性是如何源于稀疏终端奖励与连续临床轨迹的错位的。我们发现普通 GRPO 在某些基准上实现了很高的最终精度,但存在训练不稳定的问题,响应长度的显着振荡和收敛周期延长就证明了这一点。为了提高训练效率和稳定性,我们提出了回合级截断 同策略 蒸馏 (TT-OPD),这是一个自 蒸馏 框架,其中无梯度 EMA 教师利用结果特权信息在每个对话回合提供密集的、结果感知的 KL 正则化。 TT-OPD 在 18 个基准测试中的 10 个上实现了最佳性能,与非 RL 基准相比平均提高了 +3.9~pp,具有更快的早期收敛、受控的响应长度和持续的多转工具使用。