论文
自信却矛盾:LLM中的内部不确定性与认知失调消解
Confident but Conflicted: Internal Uncertainty and Cognitive Dissonance Resolution in LLMs
摘要
大语言模型(LLM)频繁遇到与其先前输出不一致的输入——经由用户反驳、检索文档或网络搜索结果。虽然它们消解此类冲突的方式——我们框定为认知失调消解——已获行为学刻画——其与内部模型不确定性的联系尚不清楚。为系统研究——我们沿来源权威与证据质量两个维度、跨12条分层认识论地位的健康科学声明变化说服尝试。失调可经说服、回火或免疫消解。我们引入信任弹性(TE)——受计量经济学启发的度量:模型被相互冲突证据说服的难易程度。跨四个LLM——TE变化显著——而明显虚假的声明在所有模型上引出近零TE。在两个开放权重模型上——我们进一步发现该变化与两个互补的内部不确定性指标相关:Qwen中的置信度失准与Llama中的内部不确定性变化。这些结果把跨模型行为变异联系到可测量的内部属性——并指向以内部不确定性为靶的干预作为未来工作。
