论文
PROSE:以推理过程奖励修正医疗问答测试时强化学习
Rewarding Reasoning, Not Answers: Fixing and Bounding Test-Time Reinforcement Learning on Medical QA
摘要
测试时强化学习使用多数票伪标签在其自己的未标记测试集上调整模型,并在数学方面显示出强大的结果。我们证明了这个方法在医学多项选择质量保证上崩溃了:准确性停滞不前,而输出多样性迅速下降。通过一个控制实验,保持问题、模型和优化器固定,同时只改变答案空间,我们将这种失败追溯到答案空间结构而不是领域难度。在较小的答案空间中,错误采样轨迹经常会与相同的错误伪标签发生冲突并对其进行强化;在较大的答案空间中,他们会分散并获得很少的奖励。这种诊断激发了 PROSE(过程奖励引导自我训练),它奖励推理质量而不是答案一致性。 PROSE 使用医疗过程奖励模型对每个推理步骤进行评分,将轨迹奖励指定为跨步骤的最低分数,并强制执行答案格式约束。在没有标签的情况下,PROSE 极大地改进了通用 Llama 模型,超越了专门构建的医疗模型并匹配了更大的系统。由于过程信号已内化到策略中,因此调整后的模型在推理时不需要奖励模型,并将其收益转移到看不见的数据集。我们进一步表明,最小聚合是至关重要的:可以利用平均聚合,使代理奖励饱和,同时降低准确性。