论文
双线性自动编码器找到可解释的流形
Bilinear autoencoders find interpretable manifolds
摘要
稀疏自动编码器已成为揭示神经网络中可解释的潜在表示的标准工具。然而,突出的概念通常跨越当前线性方法在没有事后分析的情况下无法捕获的流形。本文使用二次潜伏来缩小这一差距:我们使用双线性自动编码器来实现这些,双线性自动编码器将激活分解为低秩二次形式,在权重空间中线性组合,并允许与输入无关的几何分析。二次潜伏可以检测到的概念的这种定性差异挑战了标准线性表示假设。我们的实验和可视化表明,多维几何图形非常普遍,并且复合潜在特征可以很好地捕获它们,从而系统地改善语言模型中的重建错误。此外,我们表明,具有不同几何先验的自动编码器恢复相同的输入子空间,尽管它们的字典条目不同。实际上,这些模型可以作为多种发现的无监督工具,我们通过 Qwen 3.5 的交互式在线可视化工具进行了演示。这是朝着非线性但数学上易于处理的潜在表示迈出的一步,其组成通过设计具有表现力和可解释性。