论文

Mind DeepResearch技术报告

Mind DeepResearch Technical Report

智能体系统模型训练强化学习Agent 协作Agentic RL

摘要

我们提出了 \textbf{Mind DeepResearch (MindDR)},这是一种高效的多智能体深度研究框架,通过精心设计的数据合成和多阶段训练管道,仅使用 \textasciitilde30B 参数模型即可实现领先的性能。 MindDR的核心创新在于协作式三智能体架构(规划智能体、深度搜索智能体和报告智能体)以及由SFT冷启动、搜索强化学习、报告强化学习和偏好对齐组成的四阶段智能体专业训练管道。通过这种机制,MindDR 即使使用 \textasciitilde30B 规模的模型也能表现出具有竞争力的性能。具体来说,MindDR 在 BrowseComp-ZH 上达到 45.7\%,在 BrowseComp 上达到 42.8\%,在 WideSearch 上达到 46.5\%,在 xbench-DS 上达到 75.0\%,在 DeepResearch Bench 上达到 52.5,超越了同等规模的开源代理系统,并与更大规模的模型相媲美。 MindDR已作为在线产品部署在理想汽车中。此外,我们还引入了 \textbf{MindDR Bench},这是一个从我们内部产品用户交互中收集的 500 个真实中文查询的精选基准,通过全面的多维评分系统进行评估,而不是依赖于单一的 RACE 指标。在 MindDR Bench 上,MindDR 取得了 51.8 的最高分数。

Mind DeepResearch技术报告
图 2:MindDR 多代理框架概述。用户查询首先由规划代理处理,规划代理执行意图分析和任务分解以生成结构化的子任务规范。每个子任务都被分派到一个独立的 DeepSearch Agent 实例,该实例执行 ReAct 式循环,同时维护扩展思想链 (XoT) 推理跟踪。生成的子报告由报告代理进行汇总,从而合成一份连贯的、基于引文的研究报告。