论文
OpenSeeker:通过完全开源训练数据普及前沿搜索智能体
OpenSeeker: Democratizing Frontier Search Agents by Fully Open-Sourcing Training Data
摘要
深度搜索能力已成为前沿大语言模型(LLM)智能体不可或缺的能力,但由于缺乏透明、高质量的训练数据,高性能搜索智能体的研发仍被工业巨头主导。这种持续的数据稀缺从根本上阻碍了更广泛的研究界在该领域的开发与创新进展。为弥合这一差距,我们提出OpenSeeker,首个实现前沿级性能的完全开源搜索智能体(即模型与数据均开源),其核心技术创新有二:(1)基于事实的可扩展可控问答合成,通过拓扑扩展与实体混淆对网络图进行逆向工程,生成覆盖率与复杂度可控的复杂多跳推理任务。(2)去噪轨迹合成,采用回溯式总结机制对轨迹去噪,从而促使教师LLM生成高质量动作。实验结果表明,OpenSeeker仅用1.17万个合成样本进行一次训练,就在BrowseComp、BrowseComp-ZH、xbench-DeepSearch和WideSearch等多个基准上取得最先进性能。值得注意的是,仅以简单SFT训练的OpenSeeker显著优于完全开源智能体中的第二名DeepDive(例如在BrowseComp上29.5%对15.3%),甚至在BrowseComp-ZH上超过经大规模持续预训练、SFT和RL训练的Tongyi DeepResearch等工业竞品(48.4%对46.7%)。我们完全开源完整训练数据集与模型权重,以推动前沿搜索智能体研究的普及化,并促进更透明、更协作的生态。
