论文
Prolepsis 的最低架构是什么?小 Transformer 中跨任务的早期不可撤销承诺
What Is the Minimum Architecture for Prolepsis? Early Irrevocable Commitment Across Tasks in Small Transformers
摘要
Transformer 何时做出决定?什么阻止他们纠正该决定?我们引入 prolepsis:Transformer 提前承诺,特定任务的注意力头维持承诺,并且没有层纠正它。复制 Lindsey 等人 (2025) 在开放模型(Gemma 2 2B、Llama 3.2 1B)上的规划地点发现,我们提出五个问题。 (Q1) 规划对于六种残差流方法是不可见的;在这些测试中,只有基于 CLT 的转向能够成功。 (Q2) 单站点峰值在最后的提示标记处复制形状(Anthropic 的站点是换行符;请参阅添加的注释)。 (Q3)特定的注意力头将决策路由到输出,填补了归因图上标记为不可见的空白。 (Q4) 证据与最多 16 层内的搜索和超出的承诺一致,这是一个双模型假设。 (Q5) 事实回忆显示不同网络深度的相同主题,重复规划头与事实前 10 名之间的重叠为零。预测在测试的仅解码器模型中的任务中重复出现:模板是共享的,路由基底不同。所有实验都在单个消费级 GPU(16 GB VRAM)上运行。