论文
通过预测导航进行深入研究预训练
Deep Research Pretraining via Predictive Navigation
摘要
深度研究代理通常接受昂贵的、基于环境的工具使用轨迹的训练,需要重复检索、文档检查和报告评估。我们引入深度研究预训练(DRP),这是一个离线框架,可以从自然发生的证据结构中得出预测导航监督。给定一个带有引文或超链接的段落,DRP 构建一个代理研究目标,恢复链接证据和与图形相关的替代方案,并将它们转换为搜索-打开-写入轨迹。这教会模型要搜索什么、要检查哪些文档以及如何合成证据,而无需实时检索环境或采样策略执行轨迹。我们在学术引文图 (DRP-Paper) 和维基百科超链接 (DRP-Web) 上实例化 DRP,不断在 1B 词元上预训练单独的 Qwen3-14B-Base 模型,并在 13K 代理轨迹的受控部分上对它们进行微调。在每个低数据预算下的五个独立采样子集中,两种变体的性能始终优于 DeepResearch Bench 上匹配的无 DRP 模型。凭借四分之一的 SFT 数据,DRP-Web 甚至超越了固定的无 DRP 全数据检查点,并将收益转移到 ResearchQA、WebWalkerQA 和 SimpleQA。从匹配的低数据 SFT 检查点开始,DRP-Web 的优势也通过后续的代理 RL 持续存在。源匹配和证据不匹配控制表明,这些改进源于证据条件导航,而不是领域暴露或代理格式模仿。因此,DRP 为基于轨迹的智能体训练提供了一种有前途的补充方法。