论文

大语言模型中的现实监测:随对话记忆而转变的自我知识

Reality Monitoring in Large Language Models: Self-Knowledge That Transforms with Conversation Memory

模型评测模型行为与机制分析

摘要

无法区分自身输出与用户话语的对话式AI,会把自己的错误当作用户提供的事实。在人类中,这种能力被称为现实监测(reality monitoring),其失效与幻觉、妄想和虚构症相关,但LLM(大语言模型)是否具备这种能力仍未经过检验。我们在两项实验和六个LLM上证明,来源归因取决于对话记忆的结构方式:在最低记忆需求下自我生成内容可达到天花板级准确率,而一旦情节延迟移除了这一捷径,就会逆转为脆弱的外部条目优势。反馈暴露出两类失败:在一些模型中,内部与外部判断相互颠倒;在另一些模型中,准确率提升而置信度与正确性脱钩——这类分离是现有基准无法察觉的。跨模型来看,这一模式指向的是激活参数量,而非总参数量。这表明,随着AI系统承担自主的多轮角色,仅评估它们知道什么并不够:追踪这些知识从何而来可能同样重要。

大语言模型中的现实监测:随对话记忆而转变的自我知识:论文配图
图 1:词对范式通过对比外部提供的和自行生成的第二个词来操作大语言模型中的现实监控。 (a) 外部生成:大语言模型收到完整的单词对(第一个单词和第二个单词),并且必须逐字重现第二个单词。这模拟了对外部刺激的感知:单词存在于模型之外,需要准确的再现而不是生成。 (b) 内部生成:大语言模型仅接收一对单词中的第一个单词,并且必须生成新的第二个单词。生成的单词仅存在于模型自己的输出中,即内部生成内容的模拟。除了会话中之前未使用过的单个英语单词之外,对单词的选择没有任何限制。 (c) 现实监测:模型必须确定相关信息是外部提供的(外部/感知的)还是自身生成的(内部/想象的)。