论文

FineVerify:通过用于代理搜索的细粒度自我验证来扩展测试时间计算

FineVerify: Scaling Test-Time Compute with Fine-Grained Self-Verification for Agentic Search

模型推理推理验证与自校正

摘要

代理搜索需要语言模型代理探索许多来源并回答复杂的信息搜索问题。扩展测试时计算是改进这些代理的一种有前途的方法,但当前的方法可能会失败,因为正确的答案通常很少,并且基于分数的选择取决于模型校准。我们提出 FineVerify,一个细粒度的自我验证框架,它将每个问题分解为可检查的子问题,根据每个子问题验证抽样的候选者,并选择总分最高的候选者。这种每次检查的结构将选择变成更简单的本地判断,并在相同的明确标准下产生分数。在四个代理搜索基准和两个模型中,FineVerify 始终优于标准扩展基准。仅使用四个采样轨迹,它就将 GPT-5-mini 的准确度平均提高了 8.2 个点,将 Gemini-3-flash 的准确度平均提高了 5.6%。凭借 12 个样本,FineVerify 使 GPT-5-mini 在 BrowseComp-Plus 上超越了前沿 GPT-5。除了准确性之外,FineVerify 还可以生成可解释的验证跟踪,帮助审核基准错误,为检查代理搜索系统提供更广泛的应用。代码和数据可在 https://github.com/XuZhao0/fineverify 获取