论文

信念与现实的分离存在于语言模型中共享值槽的路由中

Belief-reality separation lives in routing over a shared value slot in language models

模型评测模型行为与机制分析

摘要

有能力的语言模型将角色的信念与事实分开:告诉“安娜相信杯子是蓝色的;实际上它是红色的”,他们对安娜的回答是蓝色,对世界的回答是红色。这种分离存在于计算中的哪个位置?我们展示它位于两个位置的两个可分离的机构上。通用值槽绑定属性值。查询位置处的路由器选择查询读出哪个帧、角色的信念或现实。两条路线填补了这个空缺:一个断言的信念,其价值由文本提供,直接绑定;派生的信念,其价值必须从角色可以看到的东西中推断出来,通过可见性门控的回溯来实现。在任一路线上训练的子空间会引导另一路线,并且只有派生路线取决于所描述的可见性。老虎机本身不带有信念-现实标签:对其进行干预会像信念一样强烈地移动现实读数。相反,分离存在于一对分离的路由子空间中,它们在帧之间翻转查询而不注入捐赠者的值。这些结果适用于三种架构,针对与心理理论基准捷径进行去混杂的刺激;该行为本身出现在 5 个模型系列的 3B 和 7B 之间。本文深入发展了单一信念-现实轴;配套论文显示,句子可以打开的其他非实际上下文(反事实、虚构、时间)共享相同的槽和路由器格式。