TRACE:搜索Agent并行扩展的轨迹选择
TRACE: Trajectory Selection for Parallel Scaling of Search Agents
摘要
并行搜索可能会生成最终答案投票未能选择的正确答案。我们将这个巩固阶段表述为轨迹选择,并引入 TRACE(具有聚合交叉rollout证据的轨迹排名),这是一种轻量级的学习选择器,它使用答案背后的搜索证据对完整的轨迹进行排名。 TRACE 保留单独的查询和证据事件,通过共享内容或文档标识连接部署,并在这些关系中传播信息。然后,每个候选答案都会读取其自身轨迹的更新状态,保留检索来源,同时合并相关rollout的证据。 TRACE 经过对冻结文本嵌入的答案级监督训练,无需额外搜索或自回归聚合即可返回现有答案。每个搜索设置一个选择器可以跨部署策略和Agent主干传输,无需针对特定Agent进行微调,从而以 $K=16$ 的价格改进跨六个 WebQA 策略和六个长期数据集主干组合的投票。在 Qwen2.5-14B Base/SFT WebQA 池上,TRACE 实现了 45.2/49.2% EM,而最强的 Qwen3-32B 生成聚合器的 EM 为 43.9/48.0%。在 long-horizon FRAMES、GAIA 和 BrowseComp 上,它的平均准确率达到 78.6%,超过多数投票 3.1 个百分点。在 Base WebQA 池中,仅rollout 8 次的 TRACE 与 64 次投票的多数投票相差不到 0.4 个百分点。在所有七个 WebQA 基准测试中,TRACE 的处理吞吐量比 SolAgg、SummAgg 和 AggAgent 至少高出 10 倍。这些结果表明,重用交叉rollout搜索证据为并行搜索的重量级生成聚合提供了有效且高效的替代方案。代码可在 https://github.com/Jaasssoooonnnnn/TRACE. 获取