论文

带序贯计划反思与候选交叉的深度研究员(Deep Researcher Reflect Evolve)

Deep Researcher with Sequential Plan Reflection and Candidates Crossover (Deep Researcher Reflect Evolve)

智能体系统Agent 规划

摘要

本文介绍一种新型深度研究员架构,旨在通过解决并行扩展范式的固有局限,为复杂的博士级主题生成详细的研究报告。我们的系统利用两项关键创新:经反思的序贯研究计划精化和候选交叉算法。序贯精化过程被证明是一种高效方法,使智能体能够维护集中式的全局研究上下文,从而回顾当前进展、推理研究计划并在运行时智能地做出更改。这种动态适应与常受困于知识孤岛的并行方法形成对比。候选交叉算法通过部署多个具有不同参数的LLM候选来探索更大的搜索空间,并综合其发现以整理全面的最终研究回答,进一步提升了搜索效率。该过程以一次性报告生成结束,确保最终文档具有统一的叙事和高事实密度。由Gemini 2.5 Pro驱动,我们的深度研究员在DeepResearch Bench(一个包含100项博士级研究任务的全球公认基准)上评估。我们的架构取得46.21的总分,超越了DeepResearch Bench活跃排行榜上的领先深度研究智能体,如Claude Researcher、Nvidia AIQ Research Assistant、Perplexity Research、Kimi Researcher和Grok Deeper Search。该性能略超我们之前的工作Static DRA,并强化了序贯扩展持续优于并行自一致性范式的发现。

带序贯计划反思与候选交叉的深度研究员(Deep Researcher Reflect Evolve)
图1:Deep Researchers 在 RACE 框架 4 个关键维度上的对比