论文
RLVR 中的已知报告首选项可能与当前请求冲突
Learned Reporting Preferences in RLVR Can Conflict with the Current Request
摘要
具有可验证奖励的强化学习(RLVR)已成为使用自动检查答案来提高推理任务中语言模型性能的重要方法。然而,与惯例相匹配的评估无法揭示强化一项报告惯例是否会减少对初始政策已遵循的不同要求的遵守。为了测试这一点,我们在两个报告约定下训练匹配的策略,并使用相同的初始策略作为共享参考来评估两个当前请求下的每个策略。我们通过受控干预和独立的人体校准来补充这种交叉设计。在 GSM8K 上,盒装格式 RLVR 将包含所请求的哈希格式有效负载的 Qwen2.5-7B 响应的比例减少了 35.33--74.37 个百分点,相对于五个训练种子中的四个的 95.45% 初始基线;第五个提高了 2.50 分。在四次恶化的运行中,几乎每个省略请求的有效负载的响应都保留了经过训练的盒装约定,并且相同的四个种子在两个固定释义下恶化。仅更改受监督目标中的最终答案标记就会逆转模型在三个种子中偏好的报告约定,从而提供受控证据证明这种偏好是可以学习的。在具有独立人类校准的三种设置中,约定敏感评分器下的收益超过了承诺答案正确性(即模型实际承诺的答案的正确性)的相应收益。总之,这些结果区分了三个不同的后训练结果:学习到的报告偏好、当前请求的遵守情况和承诺答案的正确性。他们表明,仅与惯例匹配的准确性并不能完全表征训练后的行为,并且会激励评估当前请求的遵守情况以及与惯例匹配的任务准确性。