论文

DeepResearch智能体系统

DeepResearch Agent System

模型推理模型训练强化学习推理策略与问题分解Agentic RL

摘要

DeepResearch Agent System是一个为深度信息检索、多步推理与自主研究任务而打造的大语言模型系统。该系统基于稀疏激活架构构建,总参数量为300亿,每个token仅激活30亿,在多个智能体搜索基准上取得最先进的性能,同时推理速度比同等规模的稠密模型快3.2倍。系统支持128K token上下文窗口,分层注意力机制较标准长上下文方法带来18.7%的准确率与23.4%的召回率提升。双模式推理引擎同时提供面向基础多步问题求解的ReAct范式与面向高性能迭代研究的IterResearch模式(最多20步推理),两者合计较单次基线提升31.2%的准确率。多工具协调整合检索、计算、网页搜索与文件解析模块,实现92.1%的工具使用准确率。基于GRPO算法的强化学习优化框架提供token级策略梯度,将训练稳定性提升35%,收敛加速42%。采用种子扩展的自动化数据合成流水线达到92.5%的可用率。基准结果包括Humanity's Last Exam 87.3%、BrowserComp Chinese 85.3%与WebWalkerQA 91.2%。系统完全开源,包括数据合成、训练与推理代码,支持学术研究、商业分析、研发支持与教育等应用。