论文

多样性是AI群体的力量

Diversity is the Strength of the AI Crowd

模型推理推理验证与自校正

摘要

顶级AI预测系统在预测未来世界事件上正接近超级预测者级准确率,但仍主要依赖现成LLM加预测专属上下文收集与脚手架。我们研究如何通过集成改进这一配方:给定固定数量的样本,哪些现成模型预测应被组合以最大化准确率?在Metaculus AI基准的二元问题上:个体准确率不够——许多前沿LLM做出高度相关的预测,限制了来自相同或相似模型的额外预测的价值。相反,最强的集成组合准确但多样的预测者——如Grok 4等模型的贡献不成比例,因为其预测与其他前沿LLM的相关性更低。结果表明AI群体的力量不来自不加区别地采样更多预测,而来自组合具有互补错误的跨模型预测——推动预测系统显式优化模型质量与多样性。

多样性是AI群体的力量:论文配图
图 1:多元化带来回报。对于我们的五个评估模型,Metaculus AI Benchmark Q2 2025 的二元事件问题的平均基线得分与 Gemini 3 Pro 的测试平均 Jensen-Shannon 散度相比。标记阴影表示最佳 B=5B{=}5 集成中每个模型的权重 a5⋆=(FT: 2,Gem: 1,GPT: 1,Grok: 1,Kimi: 0)a^{\star}_{5}=(\mathrm{FT}{:}\,2,\mathrm{Gem}{:}\,1,\mathrm{GPT}{:}\,1,\mathrm{Grok}{:}\,1,\mathrm{Kimi}{:}\,0)。讨论见§5.1。