论文

我们总需要查询级工作流吗?重新思考多智能体系统的 Agentic 工作流生成

Do We Always Need Query-Level Workflows? Rethinking Agentic Workflow Generation for Multi-Agent Systems

智能体系统Agent Harness

摘要

基于大语言模型的多智能体系统(MAS)通常通过工作流协调多个智能体来解决复杂任务。现有方法在任务级或查询级生成工作流,但两者的相对成本与收益尚不清楚。经过重新思考与实证分析,我们表明查询级工作流生成并不总是必要,因为少量 top-K 最佳任务级工作流合在一起已能覆盖等同甚至更多的查询。我们进一步发现,穷举式的基于执行的任务级评估既极其耗费 token 又常常不可靠。受自我演化与生成式奖励建模的思想启发,我们提出一个低成本的任务级生成框架 SCALE,即以优化器带少样本校准(Self prediction with few shot CALibration for Evaluation)的自预测替代完整验证执行。大量实验表明,SCALE 保持有竞争力的性能,在多个数据集上相比现有方法平均仅退化 0.61%,同时将整体 token 使用最多削减 83%。

我们总需要查询级工作流吗?重新思考多智能体系统的 Agentic 工作流生成
图1:Aflow 与我们重新思考的任务级工作流生成框架的比较。左:工作流生成期间的总 token 数(对数坐标轴)。右:最终测试性能。我们的方法 SCALE 在显著减少 token 数量的同时取得相当的性能。