论文

关于事后概念瓶颈模型的忠实性

On the Faithfulness of Post-Hoc Concept Bottleneck Models

模型评测评测方法与指标

摘要

人类的决策通过高级概念来解释世界,例如通过腹部颜色来识别鸟。为了弥合不透明的深度学习表示和人类理解之间的差距,事后概念瓶颈模型(事后 CBM)使用辅助数据集或视觉语言模型将潜在特征投影到可解释的概念空间上。然而,依靠目标任务的准确性作为事后 CBM 成功的主要衡量标准,会掩盖所学习的概念是语义上有意义的还是仅仅是预测性的产物。例如,随机概念预测尽管在语义上毫无意义,但仍可以达到有竞争力的准确性。在这项工作中,我们直接分析学习的投影并识别两种失败情况:首先,对于从辅助数据学习的概念投影,协变量转移可能导致目标任务的不忠实的概念表示。特别是,我们提供了这种转变带来的误差的上限。其次,视觉语言模型生成的替代概念标签中的系统标签噪声会导致不忠实的预测。在形式化这些故障模式后,我们引入了新颖的指标,将概念 忠实性 与预测准确性分离。我们在现实世界和综合基准中的实证结果证实,这些指标可以识别基于标准准确性的评估无法检测到的不忠行为。