论文
QUEST:用完全综合的任务训练前沿深度研究代理
QUEST: Training Frontier Deep Research Agents with Fully Synthetic Tasks
摘要
深度研究代理将搜索引擎的作用从检索关键字匹配的页面扩展到综合知识,从根本上改变了人类与信息交互的方式。然而,前沿系统仍然是专有的,而现有的开放代理通常在不同的任务类型上泛化能力较差,因此不清楚如何训练具有广泛能力的深度研究代理。我们发布了 QUEST,这是一系列开放模型(范围从 2B 到 35B),作为通用深度研究代理,旨在处理广泛的长期搜索任务,在事实搜索、引文基础和报告合成方面具有强大的能力。为了构建 QUEST,我们提出了一种结合中期训练、监督 微调 和强化学习的有效训练方案。该配方的核心是基于统一标题树的精选数据合成管道,它适用于不同的任务类型,并能够在无需人工注释的情况下合成具有可验证奖励的训练数据。此外,QUEST 还采用内置上下文管理机制,可实现有效的长视野推理和知识合成。仅使用 8K 合成任务,QUEST 在跨越不同任务类型的八个深度研究基准上接近甚至超越了前沿闭源智能体,并在近期开放权重智能体中实现了最佳的整体性能。我们发布了所有内容:模型、数据和训练脚本。