论文

当上下文误导时:LLM 中的惊讶、能量和注意力熵作为连贯性错觉的度量

When Context Misleads: Surprisal, Energy and Attention Entropy as Metrics of Coherence Illusions in LLMs

模型评测模型行为与机制分析

摘要

心理语言学研究表明,人类读者会陷入连贯性错觉:不连贯的话语可能看起来连贯,仅仅是因为干扰因素与接下来的内容相匹配。我们调查了荷兰语语言模型(6 个单语模型和 4 个多语言模型)在使用“再次”和“太”等单词链接回早期上下文的文本上是否表现出相同的行为。首先,我们发现对关键词的惊讶会追踪人类的可接受性判断和眼球追踪数据。模型对不连贯的延续感到更加惊讶,但先前上下文中的匹配干扰项减少了这种惊讶。其次,注意力熵识别出在连贯性和不连贯性下表现不同的头脑。我们发现,烧蚀这些头部显示出跨实验的转移效应,表明存在共享机制。第三,我们引入联想记忆文献中的能量作为量化话语连贯性的指标。总而言之,我们的结果表明,荷兰语 LLM 中出现了连贯性错觉,其熵和能量暴露机制可以跨设置运行。