论文
学会信任群体:面向大语言模型的多模型共识推理引擎
Learning to Trust the Crowd: A Multi-Model Consensus Reasoning Engine for Large Language Models
摘要
大语言模型(LLM)平均性能很强,但在实例层面仍不可靠:幻觉频发、失败脆弱、置信度校准差。我们通过多模型共识的视角研究可靠性:给定多个异构LLM的回答,能否学到哪个答案对给定查询最可能是正确的?我们提出一个多模型共识推理引擎,把一组LLM输出当作有监督元学习器的输入。系统用语义嵌入、成对相似度与聚类统计、词汇与结构线索、推理质量分数、置信度估计以及模型先验,把自然语言回答映射为结构化特征,然后在答案相似度图上应用梯度提升树、listwise排序与图神经网络。使用三个开放权重LLM,在GSM8K、ARC-Challenge、HellaSwag与TruthfulQA的小规模、资源受限子集上评估,我们最佳的基于图注意力的共识模型将宏平均准确率较最强单LLM提高4.6个百分点,较多数投票提高8.1个百分点,同时带来更低的Brier分数与更少的TruthfulQA幻觉。消融与特征重要性分析显示,语义一致性与聚类特征影响最大,推理质量与模型先验特征提供互补增益,这表明有监督多模型共识是让LLM行为更可靠的实用路径,即使在一台普通单机环境中亦然。
