论文
何时何地信任老师:通过熵校准信用分配统一策略蒸馏和 GRPO
When and Where to Trust the Teacher: Unifying On-Policy Distillation and GRPO through Entropy-Calibrated Credit Assignment
摘要
具有可验证奖励的强化学习(RLVR)通过最终答案的正确性来监督数学推理,但对单个标记提供的指导很少。同策略蒸馏 (OPD) 为学生生成的反应提供密集的反馈,但教师的偏好不需要反映正确性。最近的混合方案结合了 OPD 和验证者衍生的优势,或使用教师比率重新加权任务学分。然而,教师指导在基于验证者的组标准化之后进入,并且词元重新加权不需要保留分配给每个响应的总任务学分。我们引入了 GRPO 的统一熵校准信用重新分配(UECR-GRPO),它将验证者和教师信号集成在响应和词元级别的单个 GRPO 式更新中。 \emph{路径效用统一}(PUU)在单个 KL 正则化目标中结合了验证者奖励和教师与锚点路径对数比。其策略实施使用长度归一化的教师分数,并结合了组归一化之前的奖励和 PPO 剪裁,从而允许教师证据影响响应排名。然后,\emph{熵校准重新分配}(ECR)使用签名的教师-旧策略词元间隙来重新分配验证者派生的组件。全词汇教师熵减弱了不确定的指导,而响应式零和投影则保留了总任务信用及其在裁剪之前的标记式符号。在五个数学推理基准测试中,UECR-GRPO 对 Qwen3-1.7B 和 Qwen3-4B 学生的平均 \(\mathrm{Avg@12}\) 准确率分别为 17.21\% 和 65.09\%,比每个量表的最强基线高出 0.89 和 0.56 个百分点。