论文
叠加是不必要的:时间序列预测的 Transformer 表示的机械可解释性分析
Superposition Is Not Necessary: A Mechanistic Interpretability Analysis of Transformer Representations for Time Series Forecasting
摘要
Transformer 架构已广泛用于时间序列预测,但使其在 NLP 中强大的表征机制是否真正参与时间序列数据仍有待探索。简单线性模型(例如 DLinear)的持续竞争力引发了持续的争论,但尚未对这种现象提供机械解释。我们通过应用稀疏自动编码器(SAE)(一种机械可解释性工具)来探测 PatchTST 的内部表示来解决这一差距。我们首先确定单层、窄维 Transformer 与常用基准中更深层次配置的预测性能相匹配。然后,我们在 GELU 后的中间 FFN 激活上训练 SAE,字典大小范围为原生维度的 0.5 倍到 4.0 倍。扩展字典产生的下游性能变化可以忽略不计(平均 0.214%),大部分过度完整的字典仍然处于不活动状态。对显性潜在特征进行有针对性的因果干预会产生最小的预测扰动。在所有评估的设置中,我们没有观察到任何经验证据表明所分析的 FFN 表示依赖于强叠加。相反,在积极的字典扩展下,表示仍然稀疏、稳定,并且对潜在干预基本上不敏感。这些结果表明,叠加对于标准预测基准上的竞争表现来说并不是必需的,这表明它们可能不需要驱动 Transformer 在语言建模方面取得成功的丰富的组合表示,并有助于解释简单线性模型的持久竞争力