论文

SearchArt:使用可扩展的综合和验证任务训练长视野搜索代理

SearchArt: Training Long-Horizon Search Agent with Scalable Synthetic and Verified Task

模型训练合成数据

摘要

大语言模型 (LLM) 的最新进展使搜索代理能够在扩展的搜索和推理范围内自主处理复杂的任务。然而,由于缺乏可扩展和长期的任务,以及评估和纠正中间推理和工具使用行为的困难,训练有效的搜索代理仍然具有挑战性。我们推出了 SearchArt,这是一个可扩展的框架,用于通过验证驱动的任务合成和多阶段 后训练 管道来训练长期搜索代理。 SearchArt 通过综合不同的信息搜索 QA 对以及来自网络文档和自动生成的证据图的相应搜索轨迹,为复杂的搜索、研究和面向用户的任务构建大规模数据集。为了确保合成数据的可靠性,我们设计了一个验证管道,联合评估 QA 一致性、轨迹质量和检索证据的相关性。验证后的轨迹随后用于多阶段训练过程,包括监督 微调 和基于强化学习的策略优化。使用 SearchArt 训练的搜索代理在扩展的交互范围内表现出自适应搜索规划、迭代证据聚合和复杂推理。实验结果表明,仅使用(Qwen3.5-)27B参数,SearchArt在BrowseComp-ZH上得分为74.39,在BrowseComp上得分为70.06,在Deepresearch-bench上得分为52.55,在深度搜索和深度研究基准上均匹配或超越前沿闭源代理。