论文
大语言模型中的稳定失准:高置信度错误的实用视角
Stable Miscalibration in Large Language Models: A Practical View of High-Confidence Errors
摘要
大语言模型中的高置信错误常被视为内部推理脆弱的证据。我们研究另一种可能性:稳定失准,即一个自信的错误答案在小的扰动下保持局部稳定。我们结合两种诊断手段:一是标签感知的输出层审计分数,在强制作答基线下按置信波动与过度自信错误对各领域排序;二是测量隐状态移动的内部敏感性探针。在一个多领域二元事实审计集上,该审计分数能追踪引入弃权意识的自我批评在何处降低决策损失,尽管直接的有标签基线对同一收益的排序更强。在内部,自我批评式提示在三个开源权重模型中一致地降低各层的隐状态敏感性。这支持了提示诱导的局部稳定化,而非纯粹的输出层弃权模式,但它并不意味着校准良好:审计定义的过度自信错误并不比自信正确的答案明显更具局部敏感性,因此某些高置信错误可能是稳定且失准的,而非单纯脆弱。
