论文

单智能体 LLM 在平等思维下的多跳推理上优于多智能体系统 词元预算

Single-Agent LLMs Outperform Multi-Agent Systems on Multi-Hop Reasoning Under Equal Thinking Token Budgets

模型评测模型能力评测

摘要

最近的工作报告了多代理 LLM 系统 (MAS) 的强大性能,但这些收益常常因测试时间计算的增加而变得混乱。当计算标准化时,单智能体系统(SAS)可以匹配或优于 MAS,但这种比较背后的理论基础和评估方法仍不清楚。我们提出了一个基于数据处理不等式的信息论论证,表明在固定推理 词元预算 和完美的上下文利用下,单代理系统的信息效率更高。这一观点进一步预测,当单个代理的有效上下文利用率下降或消耗更多计算时,多代理系统将变得具有竞争力。我们在三个模型系列(Qwen3、DeepSeek-R1-Distill-Llama 和 Gemini 2.5)的受控实证研究中测试了这些预测,将 SAS 与匹配预算下的多个 MAS 架构进行比较。我们发现,当推理标记保持不变时,SAS 在多跳推理任务上始终匹配或优于 MAS。除了总体性能之外,我们还对系统行为和评估方法进行详细的诊断分析。我们在基于 API 的预算控制(特别是在 Gemini 2.5 中)和标准基准中发现了重大缺陷,这两者都可能夸大 MAS 的明显收益。总体而言,我们的结果表明,对于多跳推理任务,多代理系统的许多报告优势可以通过未考虑的计算和上下文效应而不是固有的架构优势来更好地解释,并强调理解和显式控制代理系统中计算、上下文和协调之间权衡的重要性。