论文
SVR:基于判决与置信度联合强化学习的自验证精炼,实现自适应测试时计算
SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute
摘要
扩展测试时计算可以改进语言模型推理,但统一预算会在简单输入上浪费算力,而验证器引导的精炼又依赖外部反馈。我们提出自验证精炼(SVR),这是一个无需神谕(oracle)的多轮强化学习框架,学习将自我验证用作计算控制策略。在每一轮,模型给出解答并同时输出离散的正确性判决与置信度分数;仅当判决为正确且置信度超过阈值时才保留当前答案,否则继续利用其自身的自我验证进行精炼。真值正确性仅用于构建训练奖励,绝不会通过精炼提示暴露给策略,推理时也无需它。SVR使用GRPO在固定时域轨迹上训练,奖励设计促进解答正确性、具备校准意识的自我验证以及随时可停止的正确状态;自适应停止仅在推理时激活。在基于Qwen3.5-2B的七个数学推理基准上,SVR仅以平均2.99个推理轮次即取得0.563的宏平均准确率。在所评估的完整系统对比中,它超过标准GRPO、强多轮基线以及固定预算的神谕引导分数反馈参照,同时所需轮次远少于固定十轮推理。这些结果表明,学习到的自我验证可以作为有效的内部控制信号,用于答案保留与自适应测试时计算分配。
