论文
复合奖励下的GRPO过滤风险:失败轨迹也可能获得虚假优势
The Filter Metric is Safety-Critical: Phantom Advantages in Group-Relative RL under Shaped Rewards
摘要
组相对策略优化(GRPO及其衍生方法)可通过动态采样丢弃没有差异的轨迹组,实际实现通常提供可配置的过滤指标。本文识别并量化复合塑形奖励下指标与过滤判定条件的语义不一致。若过滤依据是塑形训练分数而非任务结果,全失败组仍会因组内分数存在差异而通过过滤;标准差归一化随后将失败样本间的塑形差异放大为完整幅度的虚假优势。在GSM8K受控比较(Qwen2.5-1.5B、LoRA)中,不过滤和按塑形分数过滤的最终精确匹配率分别为0.080±0.112和0.040±0.008;按二元任务结果过滤为0.754±0.005。每组四次运行,报告均值与样本标准差。在verl原生recipe/dapo训练器上,固定模型、数据、奖励和训练器,仅改变过滤指标:分数组在所观察的40步中无需补充批次,最终精确匹配率为0.160;准确率组在29步中补充批次,最终为0.763。二者使用相同自定义塑形奖励钩子,未修改训练器及过滤代码。既有工作已提出塑形引起的放大及全失败组过滤;本文进一步隔离指标与过滤条件的语义错配,并直接记录原生删除、补充批次行为。所测正系数λ为0.1、0.3和0.5时,不安全设置均出现性能崩溃;单次探索性实验在MATH、15亿和70亿参数模型及GSPO下复现了失败,关闭标准差归一化则避免了所观察的崩溃。复合奖励下,过滤应依据语义独立于奖励塑形的任务结果信号。