论文

多智能体推理提升计算效率:帕累托最优的测试时扩展

Multi-Agent Reasoning Improves Compute Efficiency: Pareto-Optimal Test-Time Scaling

模型推理测试时计算扩展

摘要

推理方法的进展使语言模型无需额外训练即可改进其预测。这些方法往往优先考虑原始性能而非高性价比的计算使用。然而,对于资源受限的现实应用而言,计算效率至关重要。我们对self-consistency、self-refinement、multi-agent debate和mixture-of-agents等推理扩展策略进行系统分析,研究其计算与性能的权衡。我们在两个推理基准(MMLU-Pro、BBH)上评估这些方法,并涵盖不同模型规模下的丰富参数配置(例如扩展并行预测数、智能体数和辩论轮数)。在34种配置和超过100次评估中,我们计算帕累托最优前沿,以选出以最低计算预算达到最佳准确率的方法。值得注意的是,在MMLU-Pro上以最高评估预算(CoT计算预算的20倍)时,推理扩展相比思维链最多可提升7.1个百分点的准确率。在相同计算预算下,辩论和mixture-of-agents分别以1.3%和2.7%个百分点优于self-consistency。self-consistency较早饱和,而多智能体的收益持续存在,在更复杂的任务上尤为明显。我们得出一条简洁的多智能体设计准则:当并行生成数量超过串行聚合数量时,mixture-of-agents效率最高。

多智能体推理提升计算效率:帕累托最优的测试时扩展:论文配图
图 1:以下方面的测试时间扩展效率评级: (a) 管道选择(自我一致性、自我完善、辩论、代理混合); (b) 管道参数:绿色加号(推荐)、红色减号(不鼓励)、黄色圆圈(混合结果); (c) 思想链(橙色)与使用 15-20 倍思想链计算预算(蓝色)时所有测试的管道配置的平均性能增益相比,跨 MMLU-Pro 不同难度的任务。