论文
Transformer 前馈模块的线性程度如何?每块线性可恢复性是学习出来的,而不是架构上的
How Linear Is a Transformer Feed-Forward Block? Per-Block Linear Recoverability Is Learned, Not Architectural
摘要
Transformer 前馈网络 (FFN) 通常被视为非线性计算存储,但很少测量经过训练的 FFN 块实际上的非线性程度。我们将每个 FFN 视为位置方向的输入到输出映射,并将其拆分为精确的最小二乘线性近似加上残差。封闭式线性图解释的保留方差定义了块的线性可恢复性 (R^2_lin),这是其线性度的无优化器度量。在 GPT-2、Pythia-160m 和 llama-160m 的所有 12 个块中,R^2_lin 具有高度异构性且与深度非单调,范围从相邻块之间的近线性 (>0.99) 到强非线性 (<0.3),并且不是由激活函数设置的:同宽 GELU 模型 GPT-2 和 Pythia-160m 具有截然不同的配置文件,因此可恢复性是各个训练块的学习属性,不是建筑的。残差的低秩双线性探测仅恢复 R^2 的几个点,增益与残差非线性不相关:未恢复的计算不是单个位置乘积,而是高阶或分布式结构。该测量还用作目标压缩信号:可恢复块允许大型单层替换(GPT-2 的早期 FFN,参数减少 8 倍,困惑度为 +0.77),而低可恢复性块则标记这是不安全的。它进一步暴露了一个方法论陷阱:经过训练的线性基线可能会在病态的 Transformer 激活上严重欠收敛,因此我们在整个过程中报告了精确的封闭式最小二乘上限。