论文
用于并行扩展长期代理任务的代理聚合
Agentic Aggregation for Parallel Scaling of Long-Horizon Agentic Tasks
摘要
我们研究长期代理任务(例如代理搜索和深度研究)的并行测试时间扩展,其中并行生成多条采样轨迹并聚合成最终响应。虽然这种扩展已被证明对于思想链推理是有效的,但代理任务带来了独特的挑战:轨迹很长、多轮、工具增强,而且输出通常是开放式的。仅聚合最终答案会丢弃轨迹中的丰富信息,而连接所有轨迹会超出模型的上下文窗口。为了解决这个问题,我们提出了 AggAgent,一种将并行轨迹视为环境的聚合代理。我们为其配备了轻量级工具来检查候选解决方案并跨轨迹搜索,使其能够按需导航和合成信息。在六个基准测试和三个模型系列(GLM-4.7、Qwen3.5、MiniMax-M2.5)中,AggAgent 的性能优于所有现有的聚合方法(平均绝对值高达 5.3%,两项深度研究任务高达 10.3%),同时增加的开销最小,因为聚合成本仍然受到单个代理部署的限制。我们的研究结果表明代理聚合是一种有效且经济高效的并行测试时间扩展方法。