论文

MedCalc-R1:面向医学数学推理的知识引导奖励框架

MedCalc-R1: Knowledge-Guided Reward Framework for Medical Mathematical Reasoning

模型训练强化学习奖励建模与过程监督RLVR

摘要

在面向数学推理任务的可验证奖励强化学习(RLVR)框架中,浮点结果通常用基于容差的奖励来评估。然而该策略面临阈值校准困难、训练动态不稳定与精度受限等挑战,在临床场景尤甚。针对这些局限,我们提出知识引导的混合奖励框架(MedCalc-R1)。具体而言,我们引入知识验证奖励机制,强制显式生成计算公式,并由外部验证器进一步校验,以增强可解释性与推理可靠性。此外,我们设计软硬混合奖励方案,将基于临床安全阈值的硬约束与在可接受范围内逐步引导学习的精度敏感软奖励相结合。实验结果表明,我们的方法在推理准确率与泛化能力上均显著超越现有基线,验证了其在安全关键领域的有效性与适用性。

MedCalc-R1:面向医学数学推理的知识引导奖励框架:论文配图
图1:容忍边界的敏感性分析。严格的容忍度会明显抑制收敛速度,使曲线保持在低位。相反,过度放宽会造成高方差振荡,破坏梯度优化过程的稳定性。