论文
LLM 不确定性和正确性是否由相同的特征编码?通过稀疏自动编码器的功能分离
Are LLM Uncertainty and Correctness Encoded by the Same Features? A Functional Dissociation via Sparse Autoencoders
摘要
大语言模型 可能是不确定但正确的,也可能是自信但错误的,这就提出了一个问题:它们的输出水平不确定性和实际正确性是由相同的内部机制还是由不同的特征群体驱动的。我们引入了一个 2x2 框架,该框架沿着正确性和置信轴划分模型预测,并使用稀疏自动编码器来独立识别与每个维度相关的特征。将其应用于 Llama-3.1-8B 和 Gemma-2-9B,我们确定了三个发挥根本不同功能作用的特征群体。纯粹的不确定性特征在功能上是必不可少的:抑制它们会严重降低准确性。纯粹的错误特征在功能上是惰性的:尽管在正确和错误的预测之间显示出统计上显着的激活差异,但大多数在被抑制时会产生接近于零的准确度变化。对这两个信号进行编码的混杂特征对输出质量有害,有针对性地抑制它们可以使准确度提高 1.1%,熵减少 75%,效果可在 ARC-Challenge 和 RACE 基准测试中转移。特征类别在信息上也有所不同:来自单个中间网络层的仅 3 个混杂特征的激活即可预测模型正确性(AUROC ~0.79),从而实现选择性弃权,在 53% 覆盖率下将准确率从 62% 提高到 81%。结果表明,不确定性和正确性是不同的内部现象,对可解释性和有针对性的推理时间干预具有影响。