论文
有监督的稀疏自动编码器作为语义组合的无约束特征模型
Supervised sparse auto-encoders as unconstrained feature models for semantic composition
摘要
稀疏自编码器(SAE)已重新成为机械可解释性的重要方法,但仍面临两大挑战:L1 惩罚的非光滑性阻碍重建与可扩展性,以及所学特征与人类语义缺乏对齐。本文通过采用无约束特征模型——来自神经坍缩理论的一个数学框架——并对任务施加监督来解决这些局限。我们监督(仅解码器的)SAE 通过联合学习稀疏概念嵌入与解码器权重来重建特征向量。在 Stable Diffusion 3.5 上验证,我们的方法展现出组合泛化能力,成功重建包含训练中未见概念组合的图像,并支持在无需修改提示的情况下进行特征级干预以实现语义图像编辑。
