论文

LLM群体的智慧:语言模型集成中的聚合与污染

Wisdom of LLM Crowds: Aggregation and Contamination in Language Model Ensembles

模型评测模型能力评测

摘要

群体智慧——聚合个体判断常优于最佳个体——已在人类预测者身上被广泛研究。当“群体”由大语言模型(LLM)组成时是否出现同样现象,是一个兼具理论与实践意义的开放问题。我们让15个LLM对254个二元预测市场问题给出概率估计,并评估经典与学习式聚合方法。学习式聚合器——多层感知机与逻辑回归——优于所有个体模型与经典方法;逻辑回归与神经网络相当,提示学习式聚合的收益来自学习多样模型输出的线性组合,而非非线性交互。对神经网络所学映射做符号回归,恢复出纯模型分歧信号作为帕累托前沿上最低复杂度的有用公式,进一步支持这一解读。训练截止污染是普遍的混杂:在一组在所有模型训练截止后才解决问题答案的干净子集上,前沿云模型与较小本地模型之间表面的能力差距从35.8%缩至8.9%,且个体模型排名仅有中等稳定性。即便在每个模型训练截止时点评估预测市场,LLM仍显著较不准确,表明集体信息聚合上存在真实差距。这些发现表明LLM群体可表现出群体智慧效应,但无污染评估对可靠评估至关重要。