论文

自信却矛盾:LLM中的内部不确定性与认知失调消解

Confident but Conflicted: Internal Uncertainty and Cognitive Dissonance Resolution in LLMs

模型评测模型行为与机制分析

摘要

大语言模型(LLM)频繁遇到与其先前输出不一致的输入——经由用户反驳、检索文档或网络搜索结果。虽然它们消解此类冲突的方式——我们框定为认知失调消解——已获行为学刻画——其与内部模型不确定性的联系尚不清楚。为系统研究——我们沿来源权威与证据质量两个维度、跨12条分层认识论地位的健康科学声明变化说服尝试。失调可经说服、回火或免疫消解。我们引入信任弹性(TE)——受计量经济学启发的度量:模型被相互冲突证据说服的难易程度。跨四个LLM——TE变化显著——而明显虚假的声明在所有模型上引出近零TE。在两个开放权重模型上——我们进一步发现该变化与两个互补的内部不确定性指标相关:Qwen中的置信度失准与Llama中的内部不确定性变化。这些结果把跨模型行为变异联系到可测量的内部属性——并指向以内部不确定性为靶的干预作为未来工作。

自信却矛盾:LLM中的内部不确定性与认知失调消解:论文配图
图 1:实验框架和主要发现。通过来源权威和证据质量参数化的说服尝试(A,B),通过信任弹性(TE)量化立场修正(C)。探索内部 Logit 分布揭示了两个互补的不确定性指标,它们与跨模型行为的关联有所不同(D;图 3 中的完整分析)。 (B–D) 中显示的数据来自 Qwen3.5-9B。