论文
OffSeeker:在线强化学习并非深度研究智能体的全部所需
OffSeeker: Online Reinforcement Learning Is Not All You Need for Deep Research Agents
摘要
深度研究智能体在处理长程任务方面展现出显著潜力。然而,最先进的性能通常依赖在线强化学习(RL),由于大量API调用而在财务上昂贵。离线训练提供了更高效的替代方案,但其进展受限于高质量研究轨迹的稀缺。本文证明,构建强大的研究智能体并不需要昂贵的在线强化学习。为弥合这一差距,我们推出一套完全开源的套件,用于有效的离线训练。我们的核心贡献包括:DeepForge,一个开箱即用的任务合成框架,无需繁重预处理即可生成大规模研究查询;以及一个精心整理的资源集合,包含66k问答对、33k SFT轨迹和21k DPO对。利用这些资源,我们训练了完全离线开发的OffSeeker(8B)。跨六个基准的广泛评估显示,OffSeeker不仅在同规模智能体中领先,还能与通过重度在线RL训练的30B参数系统保持竞争力。
