论文

持久稀疏自动编码器:学习语言模型表示中特定特征的时间尺度

Persistent Sparse Autoencoders: Learning Feature-Specific Timescales in Language Model Representations

模型评测模型行为与机制分析

摘要

稀疏自动编码器 (SAE) 将语言模型激活分解为稀疏特征,但这些模型传统上独立编码每个标记,无法公开序列中持续存在的信息。我们首先证明时间持久性可以自然地出现在标准 SAE 特征中:特征激活后,隐藏状态与其方向保持一致,过去的激活有助于重建后来的隐藏状态。不同功能的持续时间差异很大。因此,我们引入了持久稀疏自动编码器(持久 SAE),这是标准 SAE 的扩展,它可以学习每个特征的持久性系数,从而允许模型仅通过重建来学习特定于特征的时间尺度。我们的实验表明,持久 SAE 在学习一系列时间尺度的同时保留了有竞争力的重建质量:短时间尺度(快速)特征保持局部可解释,而长时间尺度(慢速)特征积累识别当前上下文的信息。此外,我们在一项即时注射监测案例研究中表明,慢速特征保留了注射相关信号,并在长时间背景下保持因果有效。这些结果表明,持久 SAE 为通过持久稀疏特征解释和监控语言模型提供了新的机会。