DAGent:深度研究Agent的评估然后发展规划
DAGent: Evaluate-then-Grow Planning for Deep Research Agents
摘要
深入的研究任务需要Agent浏览广阔的知识空间,综合多个来源的证据,并根据发现的结果调整他们的计划。基于有向无环图 (DAG) 的多Agent系统适合此设置,因为它们支持并行执行并在集中的依赖上下文中隔离每个子任务。然而,现有的基于 DAG 的Agent在执行之前实例化任务级计划,并仅在观察到故障或丢失证据后才修复图表。这种先计划后补丁的策略对于深入研究来说是脆弱的:当证据最弱时,系统会做出最强烈的承诺,而后来的修订会浪费在不应该计划的分支上的计算。我们提出了 DAGent,这是一种基于 DAG 的多Agent框架,具有先评估后增长的增量规划:Orchestrator 一次一批地增长任务图,根据来自已完成节点的置信度和不确定性信号来调节每次扩展。默认情况下,分层上下文层传播紧凑的 QueryDocs,同时保留完整的执行跟踪以供按需调用。记录的 DAG 拓扑允许仅结果配方无法定义的结构 RL 信号; DAGRPO 是 GRPO 的改编版,它为执行器部署注入了拓扑条件信用,并为 Orchestrator 计划注入了结构合规性规范化。在 BrowseComp-Plus、GAIA 和 xbench-DeepSearch 中,DAGent 在 Qwen3-235B-A22B 规模上超过了最强的开源基线 5.3 / 5.8 / 2.0 点,并且领先优势在四个开源主干上复制,并在 327K 上下文中扩展到 GPT-5。在 Qwen3-8B 量表中,DAGRPO 比相同预算的仅结果 GRPO 基线提高了 3.0 平均 Pass@1 分。相同架构的比较表明,与 Plan-then-Patch 对应方案相比,证据条件规划以更低的每任务标记、工具调用和步骤足迹实现了更高的准确性。代码:https://github.com/hanwenliu6825/DAGent