论文
通过工具集成强化学习扩展医疗推理验证
Scaling Medical Reasoning Verification via Tool-Integrated Reinforcement Learning
摘要
大语言模型在医疗推理基准上取得强劲表现,但其在临床环境的部署要求严格验证以确保事实准确性。虽然奖励模型为推理轨迹验证提供了可扩展途径,但现有方法存在两个局限:只产生标量奖励值而无显式论证,以及依赖单次检索而无法在验证展开时自适应获取知识。我们提出一个Agentic框架,通过训练医疗推理验证器在评估期间迭代查询外部医疗语料来解决这些局限。我们的方法将工具增强验证与仅需轨迹级监督的迭代强化学习范式相结合,并辅以动态调整训练数据分布的自适应课程机制。在四个医疗推理基准上,该方法相较现有方法取得显著增益,特别是将MedQA准确率相对基座生成器提升23.5%,MedXpertQA提升32.0%。至关重要的是,与先前的奖励模型基线相比,该方法将采样预算需求降低8倍。这些发现表明,将验证扎根于动态检索的证据,为构建更可靠的医疗推理系统提供了一条有原则的路径。
