论文
AgentV-RL:使用 Agentic Verifier 扩展奖励模型
AgentV-RL: Scaling Reward Modeling with Agentic Verifier
摘要
验证者已被证明可以通过测试时间缩放(TTS)来增强 LLM 推理。然而,他们在复杂领域面临着重大挑战。不正确的中间推理导致的错误传播可能会导致看似合理的解决方案出现误报,而缺乏外部基础会使验证者在计算或知识密集型任务上变得不可靠。为了应对这些挑战,我们提出了 Agentic Verifier,这是一个将奖励建模转变为多轮、工具增强的审议过程的框架。我们引入互补的前向和后向代理:一个将解决方案从前提追踪到结论,而另一个则根据其基本前提重新检查结论。这种双向过程可以对解决方案进行全面、可靠且可解释的评估。为了便于实际部署,我们提出了AgentV-RL。通过主动探索和强化学习,验证者自主地将工具使用与内部推理交织在一起。大量实验表明,Agentic Verifier 在并行和顺序 TTS 下都能产生一致的性能增益。值得注意的是,我们的 4B 变体超过了最先进的 ORM 25.2%,将其定位为代理奖励建模的一个有前途的范例。