论文

量化思维多样性:加权LLM集成增益的预测定律

Quantifying Diversity of Thought: A Predictive Law of Weighted LLM Ensemble Lift

模型评测AI 基础设施Sandbox评测方法与指标Agent Sandbox

摘要

本文给出一个经实验验证的形式化定律,用于计算思维多样性为大语言模型(LLM)集成带来的增益。从第一性原理出发,我们导出LLM集成增益到“挽救质量”与“损害质量”的精确分解,得到一个计算增益的紧凑启发式。由此提取预测集成表现的指标:准确率调整的正确性相关φ_adj,加上配对的准确率差距与集体准确率。我们在来自十个开放权重模型、两个研究生级科学基准的767,520次推理上检验该定律,并加入一个新颖的智能体网络安全基准——每个模型在网络隔离沙箱中经多轮工具使用开展数字取证调查(含弃权的23,520次分级试验);所有投票均公开。在SuperGPQA上以40:60投票分割校准一次后,该启发式在校准集上以Spearman ρ=0.84预测增益;系数冻结后迁移到两个从未参与校准的数据集(GPQA Diamond上ρ=0.51、取证任务上0.84),而实测的交换质量全程以R²≥0.96追踪实际增益。原始φ几乎无预测力(全程R²≤0.09);准确率调整的φ_adj显著更优(SuperGPQA上R²=0.67),组合这些指标的启发式是三个数据集上最稳定的池化前预测器。