论文
可言语表示形成语言模型中的全局工作空间
Verbalizable Representations Form a Global Workspace in Language Models
摘要
在人类大脑处理的所有内容中,只有一小部分是可以有意识地访问的,即可用于口头报告、有意控制和灵活推理。在本文中,我们提供了 大语言模型 中出现类似功能区别的证据。使用一种新的可解释性技术——雅可比透镜,我们可以识别模型在其处理过程中的任何时刻准备表达的表示。这些表示,我们统称为 J 空间,展现了全局工作空间的功能特性:它们的内容可以被报告、有意地召唤和保存、用于承载无声推理的中间步骤、并作为参数传递给任意下游计算,而文本解析和例程推理等自动处理则无需它们即可进行。 J 空间还具有全局工作空间理论与意识访问相关的结构特征:它仅在中间层带中携带连贯的内容,一次保留数十个概念的顺序,并且通过模型的权重比其他表示形式更广泛地传播。这些属性使其成为了解模型不言而喻的思维的实用窗口。在一致性审计中,它揭示了模型输出中从未出现的战略审议、评估意识和训练有素的不一致倾向。我们发现 后训练 在工作区中安装了助手的观点,并且我们引入了反事实反思训练,通过仅训练模型在被打断并要求反思时会说的话来改善行为。这些结果表明,语言模型维护着一小部分具有特权的表征,这些表征具有意识访问的一些功能特征,并且解码这些表征可以揭示正在进行的认知过程。