论文
U-Space:分析语言模型何时及为何产生不确定性
U-Space: Uncovering When and Why Uncertainty Arises in Language Models
摘要
大型语言模型正在以越来越高的风险为决策提供信息。随着他们的错误造成的后果越来越严重,一个核心问题变得越来越难以忽视:我们在多大程度上可以相信个人的答案?然而,识别何时推迟仍然很困难,因为语言模型可能会以流畅的解释和权威的语气提出错误的结论。不确定性量化旨在通过估计个体预测的可靠性来解决这种脱节问题。然而,许多现有方法需要重复生成或单独训练组件,并且它们的标量估计不能揭示不确定性在何处出现或在推理过程中如何演变。最近的研究还表明,生成长度可能与不确定性估计和正确性密切相关,这就提出了一个问题:估计器的预测能力有多少来自于特定于不确定性的信息,而不仅仅是输出长度。机制可解释性通过将人类可解释的概念与中间模型状态连接起来,提供了一种解决这些限制的方法。在此功能的基础上,我们引入了 U 空间,这是一个低维子空间,使模型不断变化的不确定性可测量和解释。我们识别怀疑和确定性的语义锚,将它们的非嵌入方向映射回残差空间,并将它们的对比组合成正交基础。 U-Lens 将每个Token状态投影到这些基本向量上,生成可解释的Token级不确定性图,可以直接检查或聚合为标量不确定性得分。我们的方法不需要正确性标签、重复生成或训练。在推理基准中,其置信度得分优于标准和长度控制评估下的既定基线,并且比监督估计器更可靠地进行传输。代码:https://github.com/s2labres/U-Space。