论文

组合语言模型何时有用?67个前沿模型上路由、投票与智能体混合的共失败上限

When Does Combining Language Models Help? A Co-Failure Ceiling on Routing, Voting, and Mixture-of-Agents Across 67 Frontier Models

模型评测评测方法与指标

摘要

路由、投票、级联、融合与智能体混合等多模型LLM系统用于超越单模型准确率。我们表明其增益被一个领域很少报告的量封顶。对任何输出为成员模型之一的策略——准确率不能超过1减beta——beta是所有模型在同一查询上都错误的比率。相比之下——通常的诊断量——平均成对误差相关rho——无法识别beta:具有相同边际与成对相关的误差律可有不同的全错率。对beta的Clopper-Pearson界在任何路由器训练前给出有限样本证书——界定任何路由、投票或级联可交付的最大增益。跨21提供商67个模型——四分相关校准的单因子模型仍低估全错尾部:开放数学上观测beta为0.052——而完整67模型高斯copula下为0.023——约2.5倍低估——90% CI 1.7至3.4、k=17。该效应在执行评分代码上复现(beta=0.079)。把GPQA-Diamond同题改为自由作答而非选择题重开尾部——beta=0.127、五裁判组kappa 0.73-0.92——把共失败定位在答案格式而非学科。匹配质量下——低rho异构集成胜过高rho Self-MoA——但在我们池的可核查任务上——没有强查询级路由信号时组合模型很少胜过单最佳模型。增益来自模型在不同题目上失败——而非添加更多模型。

组合语言模型何时有用?67个前沿模型上路由、投票与智能体混合的共失败上限:论文配图
图 7:支柱 B,455 个三元组:最佳成员与 ρ\rho 的未加权多数票增益;增益大多为负(稳健),模型聚类下正斜率不显着。图 8:同等质量盈亏平衡(S=9S{=}9,匹配 6-模型带):低 ρ\rho 异质融合 (ρ=0.42\rho{=}0.42) 与高 ρ\rho Self-MoA (ρ=0.80\rho{=}0.80),两者均基于不同的绘图,因此自 MoA 秤无需回收样品。在预先注册的不同绘制聚合下,异构集成从信息公平 k=3k{=}3 开始(*\ast:查询引导 95% CI 排除零)击败了 Self-MoA,支持了该机制中匹配质量的多样化机制。