论文

通过动态注意力改进稀疏自动编码器

Improving Sparse Autoencoder with Dynamic Attention

模型评测模型行为与机制分析

摘要

最近,稀疏自动编码器(SAE)已经成为一种有前景的技术,通过将特征分解为一组稀疏的概念来解释基础模型中的激活。然而,在实践中确定每个神经元的最佳稀疏水平仍然具有挑战性:过度稀疏可能导致重建效果不佳,而稀疏不足可能会损害可解释性。虽然 ReLU 和 TopK 等现有激活函数提供了一定的稀疏性保证,但它们通常需要额外的稀疏性正则化或精心挑选的超参数。我们在本文中表明,使用稀疏最大的动态稀疏注意力机制可以弥补这种权衡,因为它们能够以数据依赖的方式确定激活数。具体来说,我们首先探索一类基于交叉注意力架构的新型 SAE,其中潜在特征作为查询,可学习字典作为键和值矩阵。为了鼓励稀疏模式学习,我们采用基于稀疏最大的注意力策略,根据每个神经元的复杂性自动推断一组稀疏元素,从而产生更灵活和通用的激活函数。通过综合评估和可视化,我们表明我们的方法成功地实现了较低的重建损失,同时产生了高质量的概念,特别是在 top-n 分类任务中。