论文

SPOQ:多代理软件工程的专家编排队列

SPOQ: Specialist Orchestrated Queuing for Multi-Agent Software Engineering

智能体系统Agent任务评测

摘要

多智能体AI系统显示出自动化软件工程任务的前景,但现有方法面临协调开销、质量控制差距和有限的人工监督等问题。我们引入了 SPOQ(专家编排队列),这是一种结合了三个创新的方法:(1)基于波的拓扑调度,根据任务依赖图计算并行执行波; (2) 在执行之前(计划验证)和之后(代码验证)应用质量指标的双重验证门以减少返工周期; (3) 人类代理 (HaaA) 集成,其中人类专家参与分解并可以在执行过程中进行咨询。 SPOQ 使用三层代理层次结构(Opus 工作人员、Sonnet 审阅者、Haiku 调查员)来优化成本质量权衡。我们通过四个实验评估 SPOQ。实验1:波调度接近关键路径下界(比率1.03--1.11,加速比达到14.3倍);在 2 插槽本地后端上,它可提供稳定的 1.4 倍加速。实验2:SPOQ将计划覆盖率从93.0提高到99.75,消除循环计划,并将并行度从31.0提升到75.25。实验 3:双重验证将每个任务的缺陷数从 0.34 个减少到 0.20 个,并将测试通过率从 91.25% 提高到 99.75%。实验 4:人工审核将每个任务的残留缺陷从 0.47 减少到 0.03。结果在本地托管的开放权重模型 (Qwen3.6-35B-A3B) 上复制,验证收益是否归因于编排而不是任何特定模型。跨 17 个存储库、8,589 项提交、1,822 项任务和 13,866 项测试(99.87% 通过率)的纵向研究提供了生态验证。