论文

面向测试时强化学习的工具验证

Tool Verification for Test-Time Reinforcement Learning

模型训练强化学习

摘要

测试时强化学习 (TTRL) 已成为自我进化大推理模型 (LRM) 的一个有前途的范例,通过多数投票的自我诱导奖励,实现对未标记测试输入的在线适应。然而,虚假但高频的未经验证的共识可能会成为有偏见和强化的奖励信号,导致不正确的模式崩溃。我们使用 T^3RL(测试时强化学习工具验证)来解决这种失败模式,它将测试时工具验证引入奖励估计中。具体来说,验证者使用外部工具作为证据(例如,来自代码执行)来在验证感知投票中增加验证的推出,从而为训练生成更可靠的伪标签。在各种数学难度(MATH-500、AMC 和 AIME 2024)和不同的主干类型上,T^3RL 比 TTRL 有了显着改进,在更困难的问题上有更大的进步。更广泛地说,T^3RL 可以被视为经过验证的在线数据合成,强调测试时工具验证是稳定自我进化的关键机制。

面向测试时强化学习的工具验证
图1:T 3 RL 的概念。上:多数投票伪标签可能是虚假的。T 3 RL 引入验证以压制假流行的伪标签。下:T 3 RL 通过工具执行的证据(如代码解释器)将测试时验证引入自我演化,利用经验证的rollout来稳定训练。右:T 3 RL 取得一致的增益,实现基于证据的自我演化。