论文
WriteSAE:用于循环状态的稀疏自动编码器
WriteSAE: Sparse Autoencoders for Recurrent State
摘要
我们引入了 WriteSAE,这是一种稀疏自动编码器,用于将矩阵更新写入循环语言模型状态。在 Gated DeltaNet、Mamba-2 和 RWKV-7 中,每个词元都会将矩阵形更新写入循环缓存;残差流 SAE 具有矢量形状的原子,无法直接替换该更新。 WriteSAE 学习与模型自己写入形状相同的 1 阶矩阵原子。这让我们可以测试直接替换:在 SAE 激活原子的位置,我们删除模型的写入,插入根据其 SAE 激活缩放的原子,然后继续前向传递。与删除 92.4% 的评估位置上的写入相比,原子给出了更接近的最终词元分布;按每个原子平均,率为89.8%。对于门控 DeltaNet,使用忘记门、读取查询和输出嵌入的公式可预测 logits 的变化,其中 $R^2 = 0.98$。同样的替换测试转移到 Mamba-2-370M 上的成功率为 88.1%。生成时,公式选择一个写入方向;将其写入模型写入规范 $3\times$ 的三个连续缓存位置,使得未修改模型最初排名 100--1000 的词元出现在 100% 的延续中,高于 33.3%。据我们所知,这是在状态空间或混合循环层中报告的第一个缓存级转向干预。