论文

量化上下文学习的任意不确定性,以稳健地衡量 LLM 预测置信度

Quantifying Aleatoric Uncertainty of In-Context Learning for Robust Measure of LLM Prediction Confidence

模型评测评测方法与指标

摘要

上下文学习 (ICL) 允许 LLM 通过一些演示来适应新任务,但其可靠性仍然是一个问题:预测对提示设计和模型理解上下文的能力都高度敏感,从而模糊了失败是否源于数据属性或模型限制。在这种情况下,不确定性分解(将随意性与认知源分开)尤其重要,但为标准生成任务设计的现有方法无法捕捉 ICL 的独特动态。为了解决这个问题,我们引入了自函数向量的概念,该概念建立在贝叶斯观点和 ICL 的机械解释性之上。这些向量利用内部模型表示来对上下文提示期间学习的潜在概念进行建模,从而能够直接估计贝叶斯框架内的任意不确定性,并避免对脆弱输入或解码操作的依赖。鉴于缺乏既定的基准和合适的评估协议,我们还提出了第一个严格的评估协议,其中以受控方式操纵数据,以便精确地量化任意不确定性,并将其与认知不确定性分开。通过这个新的评估框架,最初基于概念开发的综合任务,随后扩展到现实世界的数据集,我们表明,我们提出的方法可以比现有的替代方法更可靠地测量 ICL 下 LLM 预测的不确定性。此外,我们证明它可以用作可信相关应用的实用工具,例如幻觉检测。我们的研究结果为将不确定性的定量观点与模型行为的机械理解联系起来开辟了新的方向。