论文

许多心理空间的一种机制:语言模型中值槽上的共享路由器

One mechanism for many mental spaces: a shared router over a value slot in language models

模型评测模型行为与机制分析

摘要

语言构建了实际之外的话语背景:一幅画、一种信仰、一段记忆、一种假设。每一个都是一个心理空间,其中同一实体可以具有不同的值,就像一朵花在现实中是红色的,但在肖像中是紫色的。形式语义将这些上下文分开,因为它们的逻辑不同(模态、时间、信念、描述)。相比之下,福康尼尔的心理空间理论将它们视为一种空间构建操作。我们询问 Transformer 语言模型实现了其中哪一个,并找到了 Fauconnier 统一的机械版本。该模型在整个清单中使用一种路由器/槽格式:可重用的值槽存储属性内容,并且可因果操作的路由器(空间索引)选择读取哪个空间。使用分布式对齐搜索训练来控制一种空间类型(反事实的、信念的、虚构的或时间的)的子空间也控制三个模型系列上远高于随机楼层的其他空间类型。形式语义学将信仰标记为一种独特的情况,它并没有被特别地分开。路由器是低秩的,与实体身份相加组成,并通过一些后层头起作用。进一步的两个结果表明,该机制驱动推理和组合:根据规则导出的结论训练的子空间会翻转模型的推断内容,同时与其报告的内容分离,并且组合空间构建器会在共享槽上创建一个新的路由器。本文建立了跨类型的通用性。由于其在哲学、心理学和语言学(认识论、心灵理论和命题态度报告)中的特殊地位,配套论文深入发展了信念。