论文
多智能体推理提升计算效率:帕累托最优的测试时扩展
Multi-Agent Reasoning Improves Compute Efficiency: Pareto-Optimal Test-Time Scaling
摘要
推理方法的进展使语言模型无需额外训练即可改进其预测。这些方法往往优先考虑原始性能而非高性价比的计算使用。然而,对于资源受限的现实应用而言,计算效率至关重要。我们对self-consistency、self-refinement、multi-agent debate和mixture-of-agents等推理扩展策略进行系统分析,研究其计算与性能的权衡。我们在两个推理基准(MMLU-Pro、BBH)上评估这些方法,并涵盖不同模型规模下的丰富参数配置(例如扩展并行预测数、智能体数和辩论轮数)。在34种配置和超过100次评估中,我们计算帕累托最优前沿,以选出以最低计算预算达到最佳准确率的方法。值得注意的是,在MMLU-Pro上以最高评估预算(CoT计算预算的20倍)时,推理扩展相比思维链最多可提升7.1个百分点的准确率。在相同计算预算下,辩论和mixture-of-agents分别以1.3%和2.7%个百分点优于self-consistency。self-consistency较早饱和,而多智能体的收益持续存在,在更复杂的任务上尤为明显。我们得出一条简洁的多智能体设计准则:当并行生成数量超过串行聚合数量时,mixture-of-agents效率最高。
