论文

位置混杂优化下奖励劫持与推理-答案解耦的测量

Measuring Reward Hacking and Reasoning-Answer Decoupling Under Position-Confounded Optimization

模型评测模型训练强化学习模型行为与机制分析RLVR

摘要

当一个奖励在每个训练样本上都正确、却与多于一个目标相一致时,模型可能习得非预期的目标,这类失败被称为目标误泛化。训练分布上的端点准确率无法区分二者,因为解出任务与利用表面特征同样能满足奖励。我们将其视为一个测量问题:当模型针对一个正确但混杂的信号完成优化后,基准分数究竟测量了什么?我们在正确答案恒为选项A的多选题数学问题上用GRPO训练语言模型,然后在答案位置无偏的未见测试集上评估。在Qwen2.5、Llama 3.x与Gemma-3模型上,有偏训练常使较小模型的选项A率超过0.90,并使无偏准确率塌缩到随机水平,于是准确率不再测量数学能力,而是测量一种答案位置策略。我们进一步发现推理-答案解耦:有能力的模型生成的推理能得出正确数值答案,却仍选择A。我们用数值抽取与LLM裁判(GPT-4.1-mini)追踪这一现象(Qwen2.5-3B的解耦率约为0.66)。这种被破坏的构念会泛化到训练域之外:有偏模型在域外MMLU和价值相关提示上抬高A率。在无偏数据上继续训练能不均匀地逆转域内偏移,且只能部分逆转域外偏移,因此模型可能在训练分布上看似恢复正常,却对未见输入仍保有偏置。推理-答案解耦率连同答案分布与域外行为,可将能力损失与习得的、可迁移的捷径区分开来。

位置混杂优化下奖励劫持与推理-答案解耦的测量:论文配图
图1:位置随机化数学测试集上的最终域内性能。左:终点准确率。右:选项A比率。有偏课程模型与无偏课程对照组在相同的无偏测试分布上进行评估。在有偏训练下,许多模型的无偏准确率下降、选项A比率升高,表明训练时的答案位置规律迁移到了无偏评估分布上。