论文

多智能体扩展:更多答案不保证汇总更准确

Multi-agent Scaling Across Disjunctive and Compensatory Tasks

智能体系统Agent 协作

摘要

随着团队规模的增加,多代理 LLM 系统通常会得到改进,但扩展行为可能取决于任务结构。我们的核心贡献是引入 Steiner 的小组任务分类法,作为分析多智能体 LLM 扩展的框架,并将分析重点放在析取任务和补偿任务上。我们将独立采样的代理建模为给定项目的条件独立,这产生了它们的大团队限制:多数投票收敛于模型的模态答案,平均收敛于模型的项目级偏差。在选定的代表性基准、13 个开放权重模型以及最多 30 个代理的团队中,我们发现了本质上不同的扩展行为。在析取任务中,至少一个智能体正确的概率会随着团队规模的增加而增加 5-20 个百分点,但对直接回答的智能体进行多数投票几乎无法实现这一潜力,因为模型预测平均误差在 0.5 个百分点以内。多轮修正大大提高了准确性,但单轮修正的增益与 29 轮修正的增益几乎相同。相比之下,尽管它天生适合聚合,但缩放对费米估计几乎没有什么好处:模型样本之间共享的项目级偏差约占平方误差的 87%,因此平均仅减少约 6% 的误差。组合模型族有助于费米估计,但在析取任务上不会超过最强的成员。这些结果表明,任务结构以及结合成员输出的机制是团队规模扩展的基本决定因素。