论文

以不精确概率言说LLM的高阶不确定性

Verbalizing LLM's Higher-order Uncertainty via Imprecise Probabilities

模型评测评测方法与指标

摘要

尽管从大语言模型(LLM)引出不确定性的需求日增,实证证据表明经典概率不确定性框架下发展的引出技术并不总能充分刻画LLM行为。这种错配导致系统性失败模式,尤其在歧义问答、上下文学习与自我反思场景。为此,我们提出基于不精确概率的新型提示式不确定性引出技术——一个表示与引出高阶不确定性的有原则框架。其中一阶不确定性刻画对提示可能响应的不确定性,二阶不确定性(关于不确定性的不确定性)量化底层概率模型本身的不定性。我们提出通用的提示与后处理流程,直接引出并量化两阶不确定性,并在多样场景中证明其有效性。该方法使LLM的不确定性报告更忠实,提升可信度并支撑下游决策。

以不精确概率言说LLM的高阶不确定性:论文配图
图 1:先前口头不确定性分数中的故障模式集合。 (a) 模棱两可的问题的示例。 (b) 先前的不确定性分数无法区分清晰和模糊的问题分布。 (c) 先前的分数也未能跟踪预测误差的减少,这应该反映出随着提供更多上下文示例而减少的不确定性。 (d) 对答案概率/不确定性的自我反思应该可以解释答案选择背后的基本原理,但它常常无法做到这一点。