论文
多智能体推理中的流式通信
Streaming Communication in Multi-Agent Reasoning
摘要
多智能体推理系统采用“生成然后传输”范例,强制端到端延迟随管道深度线性扩展。我们引入了 StreamMA,这是一种多智能体推理系统,每个推理步骤在生成后立即传输到下游智能体,对相邻智能体进行管道传输,从而减少延迟。令人惊讶的是,这种流水线还提高了有效性:因为多步骤推理质量不均匀,并且早期步骤比后面的步骤更可靠,因此使用这些可靠的早期步骤而不是整个链可以防止容易出错的后期步骤误导下游代理。我们通过对流、串行和单一协议的首次封闭形式联合分析来形式化这两种优势,推导有效性排序、加速上限和成本比。在涵盖数学、科学和代码的八个推理基准、两个前沿 LLM(Claude Opus 4.6 和 GPT-5.4)以及三个拓扑(链、树、图)中,StreamMA 优于两个基线(HMMT 2026 上平均 +7.3 pp,最大 +22.4 pp;Claude Opus 4.6 高)。除了这些贡献之外,我们还发现了“步级缩放法则”:增加每个智能体的步数可以持续提高有效性和效率,这是一个与智能体计数缩放正交且可组合的新缩放维度。