论文

OffSeeker:在线强化学习并非深度研究智能体的全部所需

OffSeeker: Online Reinforcement Learning Is Not All You Need for Deep Research Agents

模型训练强化学习合成数据Agentic RL

摘要

深度研究智能体在处理长程任务方面展现出显著潜力。然而,最先进的性能通常依赖在线强化学习(RL),由于大量API调用而在财务上昂贵。离线训练提供了更高效的替代方案,但其进展受限于高质量研究轨迹的稀缺。本文证明,构建强大的研究智能体并不需要昂贵的在线强化学习。为弥合这一差距,我们推出一套完全开源的套件,用于有效的离线训练。我们的核心贡献包括:DeepForge,一个开箱即用的任务合成框架,无需繁重预处理即可生成大规模研究查询;以及一个精心整理的资源集合,包含66k问答对、33k SFT轨迹和21k DPO对。利用这些资源,我们训练了完全离线开发的OffSeeker(8B)。跨六个基准的广泛评估显示,OffSeeker不仅在同规模智能体中领先,还能与通过重度在线RL训练的30B参数系统保持竞争力。

OffSeeker:在线强化学习并非深度研究智能体的全部所需
图1:我们的 DeepForge 数据合成流水线概览。DeepForge 包含两个主要阶段:(a) Scalable Entity Expansion 和 (b) Complex Question Generation。在合成复杂的深度搜索任务后,我们进一步部署智能体框架以收集高质量轨迹。