论文

低方差奖励下群体相关优化中的优势尺度校准不平衡:诊断和有界恢复

Advantage Scale Calibration Imbalance in Group-Relative Optimization under Low-Variance Rewards: Diagnosis and Bounded Recovery

模型训练强化学习

摘要

在验证者风格的 RLVR 中,群体相关优化通常将优势规模视为实现细节。本文区分了两种低方差情况:不应该成为首选信号的亚分辨率抖动,以及应该在不扭曲 KL 校准的情况下学习的可信但小的基数间隙。我们提出了一种优势尺度三向校准接口:相同的组内尺度分母同时确定奖励分支强度、提示级批次权重以及奖励分支在原始基数尺度上重新表达时引发的有效KL校准。这个接口解释了为什么RLOO/Dr.GRPO可以让可信的小间隙成为KL主导,而GRPO的标准差分母可以无限制地放大微小间隙。基于该接口,我们进一步引入了奖励分辨率协议和MaxNorm-AC,分别过滤了亚分辨率间隙并在可信非零间隙上提供有界基数恢复。在密集/MoE 架构和数学/代码推理中,MaxNorm-AC 改进了最强的鲁棒尺度基线,同时截断了低方差逆尺度尾部。