符号感知门控稀疏自编码器:使用 Bi-Jump-ReLU 激活对反相关特征进行建模
Sign-Aware Gated Sparse Autoencoders: Modeling Anticorrelated Features with Bi-Jump-ReLU Activations
摘要
稀疏自动编码器 (SAE) 从 大语言模型 激活中提取可解释的特征,但标准变体强制执行非负潜在变量,因此必须将双向语义轴(例如“压力太高”与“压力太低”)拆分为两个潜在变量,从而浪费反相关特征上的字典容量。我们提出了 Sign-Aware Gated SAE (SA-GSAE),它在一种新的 Bi-Jump-ReLU 激活中结合了双边门控稀疏性、有符号无收缩幅度和辅助门监督,以便单个潜在变量携带一个解码器方向的两个极性;参数计算表明,即使反相关对很少见,符号感知也能保持参数高效。在 Pythia-1B 和 SmolLM3-3B 上的三个中深度挂钩点(六个单元,三个种子)上,半角 SA-GSAE 根据经验主导了六个单元中的三个上全角门控 SAE 的聚合平均边界,在其余三个单元上将其 R^2 匹配在 0.025 范围内,并在所有六个单元上匹配 L_0 = 64 时将死亡分数绝对减少 0.35-0.82。烧蚀表明两侧栅极和辅助损耗是必要的,而每极性不对称则不是;我们建议将完全绑定的对称变体作为默认值。盲态语义审计发现,对于 SA-GSAE 和所有测试的基线来说,潜伏体两侧之间明显的对立是罕见的,而符号条件干预显示,单个带符号潜伏体充当双向因果转盘,而一对“相反”非负潜伏体则不然;我们相应地确定了可解释性声明的范围。在全宽下,SA-GSAE 过度参数化,其报告的配置在 SmolLM3-3B 残余流站点处表现出可重现的重建崩溃;推荐的配置(带有死潜伏阈值重置的小阈值初始化)可以防止这种情况发生。