论文
言语过度自信的不同方面:一项可解释性研究
Different Facets of Verbalised Overconfidence: an Interpretability Study
摘要
大语言模型 倾向于过度自信,当证据表明对冲或弃权时给出自信的答案。使用控制逻辑必要性和可能性的受控推理场景,我们在 Qwen3-4B 中研究了这种行为,通过三种方式表达不确定性:言语认知标记、弃权和数字置信度得分。我们的结果证实了这种过度自信的趋势,特别是当模型被提示输出数字置信度分数时。在可解释性层面,我们提出了一种方法,可以差异化地识别负责不确定性和确定性的转码器特征。我们的分析表明,Qwen3-4B 的默认机制有利于通过广泛的共享特征联盟来生成确定性,而不确定性则作为由一小组专用特征介导的稀疏覆盖来实现。对这些不确定性特征进行干预既可以因果证明这种过度自信背后的不平衡,也可以减少过度自信的错误。同一组特征概括了三种不确定性表达设置、语言和分布外模态任务。