论文

验证的推理时扩展:经测试时量规引导验证的自我进化深度研究智能体

Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification

模型推理推理验证与自校正

摘要

深度研究智能体(DRA)的最新进展正在变革自动化知识发现与问题求解。尽管大多数现有努力聚焦于通过后训练增强策略能力,我们提出一种替代范式:通过以精心制作的量规为引导、迭代验证策略模型的输出来自我进化智能体能力。这一路径催生验证的推理时扩展:智能体通过评估其生成的答案来产生迭代反馈与精炼,从而自我改进。我们基于自动构建的 DRA 失败分类体系导出量规,该体系系统地把智能体失败分为五大类与十三小类。我们呈现 DeepVerifier,一个基于量规的结果奖励验证器,它利用验证的不对称性,在元评估 F1 分数上超过朴素的 agent-as-judge 与 LLM 裁判基线 12%-48%。为支持实用的自我进化,DeepVerifier 在测试时推理中作为即插即用模块集成。验证器产出详细的基于量规的反馈,反馈回传给智能体进行迭代自举,无需额外训练即可精炼响应。在由强闭源 LLM 驱动时,这一测试时扩展在 GAIA 与 XBench-DeepSearch 的困难子集上带来 8%-11% 的准确率增益。最后,为支持开源进展,我们发布 DeepVerifier-4K,一个聚焦 DRA 验证、包含 4,646 条高质量智能体步骤的精选监督微调数据集。这些示例强调反思与自我批评,使开放模型能够发展鲁棒的验证能力。

验证的推理时扩展:经测试时量规引导验证的自我进化深度研究智能体
图2:DeepVerifier 概览。它利用验证的不对称性,把复杂的验证问题分解为更小、更简单的子问题,并在认为答案不正确时为 DRA 提供纠正性反馈以供重试。