论文

利用验证-代际差距:带有置信条件验证的测试时强化学习

Exploiting Verification-Generation Gap: Test-Time Reinforcement Learning with Confidence-Conditioned Verification

模型训练强化学习

摘要

测试时强化学习已成为一种有前途的范例,可以以完全无标签的方式增强 大语言模型 的复杂推理能力。尽管现有的研究重点关注 Pass@1 性能,但优化 Pass@k 仍未得到充分探索,但在无标签环境中至关重要,无标签环境可衡量持续探索的生成覆盖率。在无标签设置中优化 Pass@k 非常重要,因为直接应用对 RLVR 有效的 Pass@k 优势设计会产生不令人满意的性能。通过深入的实证分析,我们发现了阻碍性能的根本原因:低置信度样本的伪标签估计很可能是错误的,而高置信度样本的候选答案则遭受严重的多样性崩溃。为了克服这些障碍,我们提出了 TTRL-CoCoV(带有置信条件验证的测试时强化学习),这是一种新颖的置信自适应框架,可扩展 Pass@k 覆盖范围并提高 Pass@1 性能。基于我们的关键见解,即验证能力通常领先于生成能力,TTRL-CoCoV 采用置信条件机制:对于高置信度样本,它引导验证者并应用探索增强奖励来防止多样性崩溃;对于低置信度样本,它将伪标签选择委托给验证者来过滤不正确的伪标签;对于中等置信度的样本,它完全绕过验证。大量实验表明,TTRL-CoCoV 在 6 个广泛认可的基准测试中优于最佳竞争方法,与 TTRL 相比,在 Pass@1 中实现了 +9.8% 的平均绝对增益,在 Pass@16 中实现了 +18.7% 的平均绝对增益,甚至与完全监督的 RL 方法相比,在多个推理基准中实现了高达 +5.0% 的绝对 Pass@1 改进。我们的代码存储库:https://github.com/shanjf666/CoCoV。