论文
大语言模型中的现实监测:随对话记忆而转变的自我知识
Reality Monitoring in Large Language Models: Self-Knowledge That Transforms with Conversation Memory
摘要
无法区分自身输出与用户话语的对话式AI,会把自己的错误当作用户提供的事实。在人类中,这种能力被称为现实监测(reality monitoring),其失效与幻觉、妄想和虚构症相关,但LLM(大语言模型)是否具备这种能力仍未经过检验。我们在两项实验和六个LLM上证明,来源归因取决于对话记忆的结构方式:在最低记忆需求下自我生成内容可达到天花板级准确率,而一旦情节延迟移除了这一捷径,就会逆转为脆弱的外部条目优势。反馈暴露出两类失败:在一些模型中,内部与外部判断相互颠倒;在另一些模型中,准确率提升而置信度与正确性脱钩——这类分离是现有基准无法察觉的。跨模型来看,这一模式指向的是激活参数量,而非总参数量。这表明,随着AI系统承担自主的多轮角色,仅评估它们知道什么并不够:追踪这些知识从何而来可能同样重要。
