论文

相同的概念,不同的方向:稀疏自编码器中的跨模态特征异构性

Same Concept, Different Directions: Cross-Modal Feature Heterogeneity in Sparse Autoencoders

模型评测模型行为与机制分析

摘要

视觉语言模型将图像和文本映射到联合嵌入空间中。然而,这些嵌入通常会纠缠多个语义特征,这限制了它们的可解释性和可控性。虽然稀疏自动编码器已经成为将这些嵌入分解为单语义特征的有用工具,但它们在联合嵌入空间中的应用很大程度上依赖于一个隐式的、未经测试的假设,即语义对应的特征在模态之间共享相同的方向。在本文中,我们通过识别图像和文本模态中同一概念的特征方向差异来挑战这一假设,我们将这种现象称为跨模态特征异质性。我们证明,这种异质性是模态分裂的关键驱动因素,其中共享概念根据模态激活不同的潜在因素。这一发现进一步揭示了为什么仅调整潜在激活不足以解决潜在的特征不匹配问题。受这一观察的启发,我们提出了一种方法,训练特定于模态的稀疏自动编码器以保留每种模态的特征几何形状,然后事后对齐相应的特征。我们的方法提高了重建保真度并增强了跨模式检索和概念引导的性能。