论文

使用概念注释评估稀疏自动编码器的可解释性

Evaluating the Interpretability of Sparse Autoencoders with Concept Annotations

模型评测模型行为与机制分析

摘要

稀疏自动编码器(SAE)越来越多地用于从视觉和视觉语言模型中提取可解释的概念,但现有的评估方法很大程度上依赖于代理指标或定性检查,而不是测量语义对应性。我们提出了一个以人为本的评估框架,无需用户研究即可量化 SAE 潜在概念和人类注释概念之间的一致性,并通过有针对性的属性扰动来验证这种匹配。为了实现这种视觉干预式评估,我们构建了 synCUB 和 synCOCO,这是仅在一个属性上不同的配对图像的综合基准。我们引入了完全二元匹配追踪(FBMP),这是一种基于联盟的匹配过程,支持 SAE 潜在和带注释的概念之间的多对一映射,并且始终优于一对一基线。对于功能验证,我们提出了目标属性扰动对齐分数(TAPAScore),它测试匹配的概念在目标图像级属性扰动下是否有选择性地并按预期方向做出响应。在健全性检查下,我们的匹配和 TAPAScore 是唯一能够可靠区分经过训练的 SAE 和未经训练的 SAE 的评估指标。在接受 CLIP 和 DINOv2 嵌入训练的 SAE 中,我们发现过度完整性的增加可以减少扰动对齐,表明可解释性降低。我们的评估框架表明,适度的字典大小可以提供最佳的权衡,从而产生最可解释的 SAE。代码和数据集可在 https://github.com/JonasKlotz/sae-concept-eval 获取。