论文
PrimeSeeker:深度搜索Agent的面向能力的监督
PrimeSeeker: Capability-Oriented Supervision for Deep Search Agents
摘要
大语言模型搜索Agent通常使用综合问题进行训练,通过更大的证据图、额外的跳跃和更长的轨迹来增加其难度。然而,这些全局属性只是搜索期间所需的本地检索能力的间接Agent。为了解决这种不匹配问题,我们引入了潜在锚点推理,其中包括从描述性规范中解析未命名的检索锚点,并将恢复的锚点转移到后续的信息需求中。该原始检索单元将深度搜索分解为耦合操作链,并围绕锚解析和关系转移组织问题构造,而无需规定规范搜索路径。基于这个公式,我们提出了 PrimeSeeker,一个面向能力的框架,构建基于网络的锚结构并共同导出问题和参考证据框架。该框架保留了构建过程中的支持证据,并通过当前工具观察的提取要点来指导专家生成。这些亮点在监督微调之前被删除,而骨架随后被重新用于审核强化学习奖励的参考步骤覆盖范围。我们构建了 9,221 条专家轨迹,训练了 30B 搜索Agent。在五个深度搜索基准测试中,PrimeSeeker 取得了强劲的性能,而参考步骤优化进一步改进了监督策略。由此产生的轨迹表现出较低的检索冗余,并且固定预算评估显示出强大的解决方案覆盖率,并且比长视野系统的工具调用要少得多。