论文
VERPO:经过验证的证据规范化政策优化
VERPO: Verified Evidence Regularized Policy Optimization
摘要
可验证的奖励通过可靠的任务级反馈改进语言模型,但基于组相对策略优化(GRPO)的方法在所有词元中统一应用序列级优势。这种粗略的信用分配强化或惩罚了整个反应,而没有确定要保留、强化或修改哪些局部决策。相反,有证据条件的自我 蒸馏 提供了更密集的 词元级 监督,但教师模仿可能会转移风格伪影和错误校准的信心,从而在与任务成功不一致时破坏训练的稳定性。我们引入了 VERPO,它将证据条件指导转换为与奖励一致的 词元级 学分分配,同时保留结果目标。 VERPO 将教师指导分解为无证据的参考术语,并在每个标记上签名、由证据引发的更正。停止的控制器通过平衡本地 GRPO 更新方向与 Fisher 移动成本的对齐,将选择性接受、词元明智的本地化和成本感知扩展结合起来。此外,我们引入了费舍尔证据对比(FEC),它通过正则化投影减弱沿估计证据存在方向的干扰变化。在五个科学推理和工具使用任务中,VERPO 可以防止优化崩溃,并始终在模型主干上实现最高的多任务平均值,特别是在强基线上的较小模型上产生显着的改进。定性诊断证实,词元接受选择性地针对与本地奖励调整和费舍尔移动成本一致的推理瓶颈。