论文

以推理致多样:为未来预测驾驭LLM群体智慧

Diverse by Reasoning: Harnessing the Wisdom of LLM Crowds for Future Prediction

模型推理推理验证与自校正

摘要

大语言模型(LLM)越来越多地被用于未来预测,这促使将多个模型用作群体智慧机制。然而,单纯增加群体规模并不能保证有效的多样性,因为不同的LLM可能表现出冗余行为。我们提出一个行为感知框架来构建多样化的LLM群体。该框架用模型在独立开发任务上的推理轨迹来刻画模型,按行为相似性聚类模型,并选择代表进行集体预测。我们评估25个LLM,使用七个开发基准进行行为多样性建模,并使用两个未来预测基准评估多样化群体的表现。我们的结果表明,群体构成可能比群体规模更重要:基于K-means++行为聚类的三模型中心点(medoid)群体在两个预测基准上都优于对所有25个模型的常规投票,同时将模型调用减少88%、推理成本降低约80%。结果进一步表明,具有代表性的行为多样性,而非简单地最大化多样性,对构建有效的LLM群体很重要。