论文
SAE 中的速率-失真-多语义权衡
The Rate-Distortion-Polysemanticity Tradeoff in SAEs
摘要
稀疏自动编码器(SAE)可以通过有效利用少量特征(最小化速率)来准确地重建其输入(最小化失真),但通常无法学习单语义表示(高度可解释),从而限制了它们在机械可解释性方面的有用性。在本文中,我们描述了学习忠实、高效和可解释的解释中的这种张力,引入了 SAE 中的速率-失真-多语义权衡。在玩具建模假设下,我们从理论上和经验上表明,将 SAE 限制为单语义必然会导致速率和失真的增加。假设输入观察背后有一个生成模型,我们进一步证明最佳 SAE 的多语义程度是由训练数据分布决定的,尤其是由特征同时出现的概率决定的。最后,我们通过推导数据生成过程未知时多语义度量应满足的必要条件,将分析扩展到现实世界设置,并在 大语言模型 上训练的 SAE 上对现有代理指标进行基准测试。总而言之,我们的研究结果表明,多语义性是一个数据问题,在架构和优化级别解决该问题时应予以考虑。