论文
S1-DeepResearch:超越搜索迈向真实世界长程研究智能体
S1-DeepResearch: Beyond Search, Toward Real-World Long-Horizon Research Agents
摘要
深度研究代理旨在通过长期规划、证据收集、推理和报告生成来解决复杂的知识密集型任务。虽然搜索代理的最新进展展示了信息检索和答案验证方面的强大能力,但大多数现有的训练数据集仍然以搜索为中心,主要关注封闭式问答和信息本地化。因此,它们主要训练信息查找行为,同时提供有限的关键深度研究能力,包括证据整合、知识合成、规划、文件理解和结构化报告生成。在这项工作中,我们为深度研究代理提出了一种统一的轨迹构建范式,结合了封闭式质量保证和开放式探索。所提出的框架包括基于图的任务制定、代理轨迹采样轨迹和多维轨迹验证,能够跨长链复杂推理、深入研究指令跟踪、报告编写、文件理解和生成以及技能使用的高质量代理轨迹的可扩展合成。与现有的面向搜索的数据集相比,我们的合成轨迹更加强调知识合成、复杂推理和规划。 S1-DeepResearch-32B 在跨越 5 个功能维度(包括复杂推理、指令跟踪、报告生成、文件理解和技能使用)的 20 个基准测试中,在规模相当的开源模型中实现了最先进的性能。在几个具有挑战性的深度研究基准上,它接近领先的专有前沿模型的性能。这些结果凸显了联合建模信息获取、知识合成和面向规划的代理行为对于构建有效的深度研究代理的重要性。
