论文
OpenSeeker-v2:以信息丰富的高难度轨迹推进搜索智能体极限
OpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty Trajectories
摘要
深度搜索能力已成为前沿大语言模型(LLM)智能体不可或缺的能力,但其发展仍由工业巨头主导。典型工业配方是横跨预训练、持续预训练(CPT)、监督微调(SFT)与强化学习(RL)的高资源密集流水线。本报告显示:当有信息丰富的高难度轨迹供给时,简单的SFT方法训练前沿搜索智能体可以出奇地强大。通过三个简单的数据合成修改——扩大知识图谱规模以丰富探索、扩大工具集规模以拓宽功能、严格的低步数过滤——我们建立了更强的基线。仅用10.6k数据点训练,OpenSeeker-v2在4个基准(30B规模ReAct范式智能体)上达到SOTA:BrowseComp 46.0%、BrowseComp-ZH 58.1%、Humanity's Last Exam 34.6%、xbench 78.0%,甚至超过以重CPT+SFT+RL流水线训练的通义DeepResearch(分别为43.4%、46.7%、32.9%、75.0%)。值得注意的是,OpenSeeker-v2是同规模同范式中首个由纯学术团队仅用SFT开发的SOTA搜索智能体。我们开源OpenSeeker-v2模型权重,分享这些简单有效的发现,让前沿搜索智能体研究更普惠。
