论文

停止探测,开始编码:为什么线性探测和稀疏自动编码器在组合泛化方面失败

Stop Probing, Start Coding: Why Linear Probes and Sparse Autoencoders Fail at Compositional Generalisation

模型评测模型行为与机制分析

摘要

线性表示假设指出,神经网络激活将高级概念编码为线性混合。然而,在叠加下,这种编码是从高维概念空间到低维激活空间的投影,并且概念空间中的线性决策边界在投影后不需要保持线性。在这种情况下,具有每样本迭代推理的经典稀疏编码方法利用压缩感知保证恢复潜在因子。另一方面,稀疏自动编码器(SAE)将稀疏推理分摊到固定编码器中,从而引入了系统间隙。我们表明,这种摊销差距在训练集大小、潜在维度和稀疏性水平上持续存在,导致 SAE 在分布外 (OOD) 成分变化下失败。通过分解失败的受控实验,我们将字典学习(而不是推理过程)确定为绑定约束:SAE 学习的字典指向基本上错误的方向,并且在同一字典上用每样本 FISTA 替换编码器并不能缩小差距。预言机基线证明这个问题可以通过所有测试规模的良好字典来解决。我们的结果将 SAE 失败重新定义为字典学习挑战,而不是摊销问题,并指出可扩展字典学习是叠加下稀疏推理的关键开放问题。