论文

延迟、停滞或崩溃:评估系统验证错误对 RLVR 的影响

Delay, Plateau, or Collapse: Evaluating the Impact of Systematic Verification Error on RLVR

模型训练强化学习

摘要

具有可验证奖励的强化学习(RLVR)已成为提高 大语言模型(LLM)推理能力的强大方法。虽然 RLVR 是为具有可验证 真值 答案的任务而设计的,但现实世界的验证器(例如静态代码检查器)可能会在奖励信号中引入错误。先前的分析在很大程度上将此类错误视为随机且独立的样本,得出的结论是错误只会减慢训练速度,对最终性能的影响有限。然而,实际验证者往往会出现系统错误。这引入了模型从结构上不正确的奖励信号中学习不需要的一致行为的风险。在这项工作中,我们研究了此类系统验证错误对 RLVR 的影响。通过算术任务的对照实验,我们表明系统性漏报会导致与随机噪声类似的影响。另一方面,系统性误报可能会导致各种行为,从次优平台到性能崩溃。至关重要的是,这些结果不是由总体错误率决定的,而是由引入错误的特定模式决定的,这使得事前缓解变得困难。我们的结果表明,与之前的结论相反,现实的验证错误可能会严重影响 RLVR 结果,并且验证者的质量必须超越其样本级别的错误率来理解。