论文

以跨模型分歧补充自一致性用于不确定性量化

Complementing Self-Consistency with Cross-Model Disagreement for Uncertainty Quantification

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型(LLM)常给出自信却错误的回答,不确定性量化是实现更稳健使用的一种潜在方案。近期工作惯于依赖自一致性来估计偶然不确定性(AU),但当模型过度自信且在各样本上给出相同错误答案时,这一代理就会失效。我们分析了这一情形,并表明恰在AU低时,跨模型语义分歧在错误答案上更高。受此启发,我们引入一个在黑盒访问设定下运作的认知不确定性(EU)项:EU仅使用规模匹配的小型模型集成所生成的文本,计算为模型间与模型内序列语义相似度之差。随后我们将总不确定性(TU)定义为AU与EU之和。在涵盖五个7-9B指令微调模型与十个长文本生成任务的全面研究中,TU相对AU改善了排序校准与选择性弃答,且EU能在AU低时可靠地标记出自信的失败。我们进一步通过一致性与互补性诊断刻画EU何时最有用。

以跨模型分歧补充自一致性用于不确定性量化:论文配图
图 1:(a) 两个模型自信地对事实问题产生不同的、不正确的答案,这导致模型内变异性 (AU) 较低,但模型之间的语义不一致 (EU) 较高。 (b) 总不确定度 (TU = AU + EU) 有效地提高了 SimpleQA 上 AUROC 的不确定度校准和正确性。