论文
Argus:可扩展深度研究代理的证据集合
Argus: Evidence Assembly for Scalable Deep Research Agents
摘要
深度研究代理在复杂的信息搜索任务上取得了显着的进展。即使是长时间的 ReAct 风格的采样轨迹也仅探索单个轨迹,而最新的最先进的系统通过并行搜索和聚合来扩展推理时间计算。然而,深入的研究答案是由互补的证据组成的,这些证据的并行采样轨迹通常是重复的而不是完整的,产生收益递减,同时将聚合上下文推向模型的极限。我们提出了阿格斯(Argus),这是一种代理系统,其中搜索者和导航者合作将深度研究视为从互补的证据片段中组装拼图,而不是并行地暴力破解整个答案。搜索器通过 ReAct 风格的交互收集给定子查询的证据跟踪。导航器维护一个共享的证据图,验证哪些部分仍然丢失,派遣搜索者收集它们,并对完整的图进行推理以产生可追溯的最终答案。我们通过强化学习来训练 Navigator 来验证、调度和合成,同时独立训练 Searcher 以保持标准的 ReAct 代理。生成的导航器支持使用单个搜索器或多个并行搜索器进行部署,而无需重新训练。由于搜索器和导航器都构建在 35B-A3B MoE 主干上,Argus 在单个搜索器上获得 5.5 分,在 8 个并行搜索器上获得 12.7 分,八个基准测试的平均值。在 64 个搜索器的情况下,它在 BrowseComp 上达到 86.2,超过了我们基准测试的每个专有代理,而 Navigator 的推理上下文保持在 21,500 个词元以下。