论文

学习多代理系统的延迟感知编排

Learning Latency-Aware Orchestration for Multi-Agent Systems

智能体系统Agent HarnessAgent Runtime

摘要

多代理系统 (MAS) 通过结构化工作流程协调多个 LLM 支持的代理,获得推理能力,但会因多步骤执行和重复模型调用而产生较高的推理延迟。现有的编排方法主要优化任务性能和推理成本,而延迟基本上没有得到解决。在 MAS 中,端到端延迟由关键执行路径控制,因此仅降低总成本并不能可靠地减少延迟。此外,在保持准确性的同时优化延迟仍然很重要:天真的延迟优化可能会错误分配操作员级别的信用并降低任务准确性。为了解决这一差距,我们提出了延迟感知多代理系统(LAMaS),这是一种用于基于学习的多代理系统的延迟感知编排框架。 LAMaS 在两个层面上解决了这一挑战:在训练时,它通过关键路径感知信用分配的约束优化来学习延迟感知执行图;在推理时,由于在训练时提交的图无法利用运行时证据,因此它使用轻量级控制器补充图构造,该控制器在执行展开时自适应地消除多余的未来代理交互。四个基准测试的实验表明,LAMaS 在评估的基于学习的 MAS 基线中实现了最佳延迟,将端到端延迟减少了 50% 以上,同时保持有竞争力或更好的准确性。 LAMaS 也是模块化的,只需进行最小的更改即可转移到其他 MAS,从而持续减少延迟。