论文
多智能体 LLM 系统中推理时间并行性的两层视角
A Two-Tier Perspective on Inference-Time Parallelism in Multi-Agent LLM Systems
摘要
大语言模型(LLM)驱动的多智能体系统在推理过程中通常需要多个模型调用和复杂的协调,其执行策略直接影响系统的准确性、延迟和计算成本。并行执行提供了一种提高推理时间效率的方法。从推理时执行的角度来看,本文将多智能体系统中的并行性建模为两个不同级别的决策过程:副本并行性(在任务级别探索多个完整的解决方案路径)和结构并行性(通过任务分解实现单个解决方案路径内的并发执行)。但对于不同形式并行的作用及其相互关系,在统一组织和协调方面还缺乏系统的研究。因此,我们提出了TIPEX,一个可控的执行框架,它统一了这两个级别的并行性,并在统一的执行语义下协调它们在推理过程中的角色,同时支持不同并行策略和参数配置的系统组合和分析。 GAIA 基准的系统实验表明,推理时间并行性可以显着提高准确性并减少端到端延迟,但代价是增加词元消耗。进一步的分析表明,副本并行和结构并行在任务复杂性上表现出互补效应,中等难度的任务从它们的协调中获益最多,而过于激进的并行策略并不一定会产生更好的性能。