论文

RLVR 中的验证者错误:奖励黑客、反馈限制和选择性控制

Verifier Errors in RLVR: Reward Hacking, Limits of Feedback, and Selective Control

模型训练强化学习RLVR

摘要

在具有可验证奖励的强化学习(RLVR)中,不完美的验证者可能会奖励不正确的响应,从而为奖励黑客创造了机会。使用带有固定验证器的梯度流,我们描述了奖励上升而正确性下降的条件。然后我们表明,RLVR 期间可用的观察结果通常不足以检测或识别可接受的错误,或保证在不牺牲正确响应的情况下减少错误。为了解决这个限制,我们使用有关审计正确性的附加反馈来构建更正。这种修正实现了\emph{选择性控制}:在当前的策略下,它降低了接受错误的概率并提高了正确响应的概率,只要它超过了验证者奖励带来的错误压力。对数线性和神经上下文老虎机以及语言模型的实验支持了分析,并表明部分审计下的选择性控制减少了可接受的错误,同时提高了正确性。