论文
VeriHarness:针对长期任务扩展 Agentic 验证
VeriHarness: Scaling Agentic Verification for Long-Horizon Tasks
摘要
随着大语言模型Agent承担越来越复杂、长期的任务,验证他们的输出变得越来越具有挑战性。我们研究如何通过固定的基础模型来增强验证能力,而无需在测试时获取参考答案或评分标准。重复采样会产生多次rollout,其中可以包含补充的正确声明,但我们需要可靠的验证机制来确定哪些声明值得信任。我们首先发现分歧常常暴露出正确的选择,而共识可以掩盖错误。这些观察结果激发了 VeriHarness,它通过为生成器提供工作空间、证据工具和可重用的验证技能,将生成器使用的底层 LLM 转变为 Agentic 验证器。分歧解决者根据环境证据检查相互竞争的主张,而共识挑战者则测试共享主张并搜索省略的要求。他们的发现指导了最终工件的选择和修改。在五个长期工作空间基准和两个前沿模型中,VeriHarness 在评估的基线中获得了最高的选择分数。有证据支持的修订进一步提高了平均性能,Gemini 3.5 Flash 的单次部署收益为 6.2 分,Claude Opus 4.8 的单次部署收益为 6.4 分。我们进一步表明,验证技能可以从失败反馈中自我改进,证明 VeriHarness 是扩展长期 Agentic 验证的一种新颖且关键的方法。我们发布了所有五个基准测试和两个模型的约 26,000 次展示的完整池,其生产成本超过 100,000 美元,以支持未来对 Agentic 验证的研究。