论文
面向测试时强化学习的工具验证
Tool Verification for Test-Time Reinforcement Learning
摘要
测试时强化学习 (TTRL) 已成为自我进化大推理模型 (LRM) 的一个有前途的范例,通过多数投票的自我诱导奖励,实现对未标记测试输入的在线适应。然而,虚假但高频的未经验证的共识可能会成为有偏见和强化的奖励信号,导致不正确的模式崩溃。我们使用 T^3RL(测试时强化学习工具验证)来解决这种失败模式,它将测试时工具验证引入奖励估计中。具体来说,验证者使用外部工具作为证据(例如,来自代码执行)来在验证感知投票中增加验证的推出,从而为训练生成更可靠的伪标签。在各种数学难度(MATH-500、AMC 和 AIME 2024)和不同的主干类型上,T^3RL 比 TTRL 有了显着改进,在更困难的问题上有更大的进步。更广泛地说,T^3RL 可以被视为经过验证的在线数据合成,强调测试时工具验证是稳定自我进化的关键机制。
