论文
AgentCPM-Report:面向开放式深度研究的起草与深化交错方法
AgentCPM-Report: Interleaving Drafting and Deepening for Open-Ended Deep Research
摘要
生成深度研究报告需要大规模的信息获取与洞见驱动的分析综合,这对当前的语言模型构成重大挑战。现有大多数方法遵循先计划后写作(plan-then-write)范式,其性能在很大程度上取决于初始大纲的质量。然而,构建一份全面的大纲本身就要求很强的推理能力,导致当前的深度研究系统几乎完全依赖闭源或在线大模型。这种依赖抬高了部署的实际门槛,并对用户创作数据引入安全与隐私方面的顾虑。在本工作中,我们提出 AgentCPM-Report,一个轻量而高性能的本地化解决方案,由一个模拟人类写作过程的框架和一个 8B 参数的深度研究智能体组成。我们的框架采用写作即推理策略(Writing As Reasoning Policy,WARP),使模型能够在报告生成过程中动态修订大纲。在该策略下,智能体在基于证据的起草(Evidence-Based Drafting)与推理驱动的深化(Reasoning-Driven Deepening)之间交替,共同支持信息获取、知识精炼与大纲的迭代演化。为有效地让小模型具备这一能力,我们提出多阶段 Agentic 训练策略,包括冷启动、原子技能 RL 与整体流程 RL。在 DeepResearch Bench、DeepConsult 与 DeepResearch Gym 上的实验表明,AgentCPM-Report 优于领先的闭源系统,并在 Insight 方面取得显著提升。
