论文

多样性指标衡量多样性吗? LLM 集成中多数票增益的能力控制审计

Are Diversity Metrics Measuring Diversity? A Capability-Controlled Audit of Majority-Vote Gain in LLM Ensembles

模型评测评测方法与指标

摘要

人们普遍认为对 LLM 的多数投票受益于多样性,并且使用多样性措施来选择要组合的模型。我们询问五个这样的衡量标准是否跟踪多样性或主要重新表达能力,将它们作为在明确的能力控制下在 MMLU-Pro 上 30 个 LLM 的 31,900 个子集(在 TruthfulQA 上为 29 个)中获得多数票超过最佳成员的预测因子进行审核。出现了三个发现。首先,潜在的互补性无处不在:预言机增益在 100% 的子集中是正的,但简单投票仅在所有规范大小 3 子集中的 9.98% 中击败了最强的成员(保留最佳选择的情况下为 18.71%);大小 2-4 的汇总率为 1.27%,部分反映了确定性的偶数大小投票行为。其次,联合正确性代理(严格多样性)几乎与一减平均准确度共线(大小 3 Spearman rho = +0.991 / +0.988);原始的多样性增益关联与能力密切相关,并且,除了一个例外,在控制下是不稳定的。第三,三个线性列联表统计量在代数上是不可分的;在能力控制之后,经验稳定的剩余部分是适度的剩余成对共同故障关联,其中更多的共享错误对应于更低的增益。这个方向是稳健的,但其大小取决于配置。将严格多样性、分歧和双重错误视为独立预测变量的联合原始空间线性回归在构造上是秩亏的。