论文

OpenSeeker-v2:以信息丰富的高难度轨迹推进搜索智能体极限

OpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty Trajectories

模型训练强化学习合成数据Agentic RL

摘要

深度搜索能力已成为前沿大语言模型(LLM)智能体不可或缺的能力,但其发展仍由工业巨头主导。典型工业配方是横跨预训练、持续预训练(CPT)、监督微调(SFT)与强化学习(RL)的高资源密集流水线。本报告显示:当有信息丰富的高难度轨迹供给时,简单的SFT方法训练前沿搜索智能体可以出奇地强大。通过三个简单的数据合成修改——扩大知识图谱规模以丰富探索、扩大工具集规模以拓宽功能、严格的低步数过滤——我们建立了更强的基线。仅用10.6k数据点训练,OpenSeeker-v2在4个基准(30B规模ReAct范式智能体)上达到SOTA:BrowseComp 46.0%、BrowseComp-ZH 58.1%、Humanity's Last Exam 34.6%、xbench 78.0%,甚至超过以重CPT+SFT+RL流水线训练的通义DeepResearch(分别为43.4%、46.7%、32.9%、75.0%)。值得注意的是,OpenSeeker-v2是同规模同范式中首个由纯学术团队仅用SFT开发的SOTA搜索智能体。我们开源OpenSeeker-v2模型权重,分享这些简单有效的发现,让前沿搜索智能体研究更普惠。

OpenSeeker-v2:以信息丰富的高难度轨迹推进搜索智能体极限:论文配图
图 1:OpenSeeker-v2 在四个代表性基准上的模型规模和范式内实现了最先进的性能,通过简单的 SFT 显着实现了这一目标,并超越了通过广泛的持续预训练、SFT 和 RL 进行训练的 Tongyi DeepResearch。