论文

仅注意 Transformer 的对照研究

A Controlled Study of Attention-Only Transformers

模型评测模型行为与机制分析

摘要

前馈网络拥有 Transformer 三分之二的非嵌入参数,但该架构尚未接受同时控制参数、计算和深度的必要测试。我们针对参数计数、训练 FLOP 和深度(2 至 48 层)单独匹配的标准 Transformer 进行预训练仅注意解码器 Transformer(简单注意网络,SAN),在 6M 至 87M 参数下最多可容纳 105B 个词元。删除适当的前馈层代价高昂:标准 Transformer 在匹配深度下领先 0.47 nat,在匹配 FLOP 下领先 0.26 nat。将释放的预算重新分配到注意力深度可以缩小差距:在匹配的参数下,差异为 0.006 纳特(损失的 0.27%),在种子对中可重现为万分之一,在 5B、30B 和 105B 预算中缩小,并在 29 倍大小范围内保持接近 0.02 纳特。三个测量定位了参数召回的剩余差距:仅注意模型在基于上下文的答案上更好,而在知识必须来自权重的情况下更糟。权重谱说明了原因:路由矩阵 (Q/K) 结晶较早,内容矩阵累积排名缓慢,移除前馈层会将这种累积重新定位到注意力输出投影。 QK 归一化(而不是前馈层或残差门控)使 48 层仅注意堆栈保持可训练性。赤字主要集中在低上下文查询预测上,并完全通过最大的预算进行本地化。预先注册的测试证实了这一说法:它预测知识密集型网络文本上的 nat 差距为 0.02 至 0.05;一对接受过 Fineweb-edu 训练的匹配组测量值为 0.040。在经过测试的制度中,剩下的就是注意力。