论文

通过工具集成强化学习扩展医疗推理验证

Scaling Medical Reasoning Verification via Tool-Integrated Reinforcement Learning

模型训练强化学习奖励建模与过程监督Agentic RL

摘要

大语言模型在医疗推理基准上取得强劲表现,但其在临床环境的部署要求严格验证以确保事实准确性。虽然奖励模型为推理轨迹验证提供了可扩展途径,但现有方法存在两个局限:只产生标量奖励值而无显式论证,以及依赖单次检索而无法在验证展开时自适应获取知识。我们提出一个Agentic框架,通过训练医疗推理验证器在评估期间迭代查询外部医疗语料来解决这些局限。我们的方法将工具增强验证与仅需轨迹级监督的迭代强化学习范式相结合,并辅以动态调整训练数据分布的自适应课程机制。在四个医疗推理基准上,该方法相较现有方法取得显著增益,特别是将MedQA准确率相对基座生成器提升23.5%,MedXpertQA提升32.0%。至关重要的是,与先前的奖励模型基线相比,该方法将采样预算需求降低8倍。这些发现表明,将验证扎根于动态检索的证据,为构建更可靠的医疗推理系统提供了一条有原则的路径。

通过工具集成强化学习扩展医疗推理验证
图2:Med-TIV 概览。左:工具集成验证(tool-integrated verification)迭代地分析推理轨迹、构造搜索查询并检索医学证据,然后给出正确性判断。中:课程式构造(curriculum formulation)过滤琐碎与不可能的实例,保留边界案例用于 RL 训练。右:推理时,验证器评估由冻结模型生成的候选医学推理轨迹,并通过加权自洽性(weighted self-consistency)选择最终答案。