论文

雅可比视角下的循环Transformer:全局工作空间能否在循环中保持?

Looped Transformers under the Jacobian Lens: Does the Global Workspace Survive Recurrence?

模型评测模型行为与机制分析

摘要

最近的工作在标准前馈Transformer中确定了一个中深度的可语言表达、因果有效的表示——全局工作空间的功能模拟。当深度是通过循环而不是一堆不同的层实现时,是否会出现相同的工作空间功能仍然未知。循环Transformer和深度循环Transformer提供了对这个问题的直接测试,因为它们在深度上重复使用相同的权重。我们使用虚拟展开适配器将雅可比透镜扩展到迭代架构。我们将完整的工作空间套件——镜头拟合、读出和 11 个因果实验系列——应用于 Ouro-2.6B(48 层循环 4 次,深度监督)和 Huginn-0125(4 层核心重复 16 次,进行潜在推理训练),使用 Qwen3.6-27B(64 个未绑定层)作为标准基线。我们发现每个架构的迭代部分都会形成一个工作空间,但这种重复会改变它的访问方式。 Ouro 在每个循环中重建工作空间内容,线性传输无法跨循环边界携带该内容;因此,写入和消融必须跨越每个剩余的循环。 Huginn 在所有 16 个循环中向前推进内容,而读取、写入和消融仅在大约两个循环的滑动窗口内起作用。新注入的内容是否可以用语言表达,跟踪明确的每次迭代监督;是否可以引导现有内容则不然。

雅可比视角下的循环Transformer:全局工作空间能否在循环中保持?:论文配图
图 2: Huginn 上的带状图热条:三种载体提示(球舱)上四个原始镜头(树;红色标记=每个镜头自己的目标)在每个源层的预期潜在候选物中最优排名(log 彩色比例;亮度更好)。所有行都读出相同的 r=16r16 前进通道;灰色单元格位于一个符合镜头要求的源区域之外。可读区域幻灯片带有镜头目标(§5.2):每个镜头只在目标之前的一对二重复中解决内容,模型回答有分级困难的谜题(从复数2中可以读取寿司,只能微弱和晚。)