论文

大语言模型 中注意力路径脆弱性作为不确定性信号

Attention-Path Fragility as an Uncertainty Signal in Large Language Models

模型评测评测方法与指标

摘要

我们提出,模型关于词元的不确定性不仅反映在其输出分布的广度上,还反映在置信预测在其注意力路径的扰动下是否\emph{脆弱}。我们将其实例化为 ASMI(注意力子网络互信息),这是一个 无需训练 估计器,它掩盖注意力头并测量生成的子网络之间的 BALD 互信息,并使用语义一致内核来消除表面形式的分歧。该信号不是输出置信度的重述:在基础 QA 上,折叠测试表明它在单通道置信度和熵之外添加了错误预测信息,集中在 \emph{confident-but-fragile} 预测中,对其进行操作大约使置信过滤器的保留误差减半。独特性是按制度分级的,因此 ASMI 预测了自己的适用性领域,在答案通过提供的上下文路由的情况下很强,在设计的范围内从参数知识中调用答案。 Sem-ASMI 从单个贪婪响应中读取信号,无需最强基线所需的随机生成,并且在 12 个基于证据的问答基准主干设置中的 10 个上与语义熵相匹配或击败。在相同的 12 个设置中,最好的 ASMI 变体(通常是自适应变体,重复使用已经为基线绘制的 10 个样本),在 8 个中与最强的基线平起平坐或领先,在配对测试中显着地在 3 个中领先。在参数 QA 上,所有变体都恢复到或低于零成本 MSP 基线,与预测完全一致,并且在重新运行时估计值几乎是确定的。头部分析表明,追踪这个边界的不是头部脆弱性的存在,而是这种脆弱性是否与错误相结合。