论文

概念瓶颈模型解释何时是忠实且紧凑的?

When Are Concept Bottleneck Model Explanations Faithful and Compact?

模型评测评测方法与指标

摘要

概念瓶颈模型 (CBM) 是神经分类器,允许通过高级概念解释其决策,从而有可能实现理解、引导和调试。然而,他们的解释通常是启发式得出的。基于正式的可解释性,我们认为它们也应该是忠实的,即不误报哪些概念真正重要。我们表明,对于广泛的 CBM 架构,包括最近基于VLM的变体,忠实的解释必须包括瓶颈中的所有概念,当瓶颈很大时,会损害可解释性。这个结果适用于启发式和忠实构造的形式解释。为了鼓励紧凑忠实解释的存在,我们建议 i)将概念概率建模为二元或分类随机变量(而不是 logits),以及 ii)通过组套索(而不是常规弹性网络)采用每个概念训练时间稀疏化。我们还将算法从形式可解释性扩展到 CBM,并表明它们在保证和解释大小方面优于自然启发法。总体而言,我们的工作对天真的可解释性主张提出了警告,并提供了正式条件和实用策略,以确保 CBM 与所宣传的一样可解释。

概念瓶颈模型解释何时是忠实且紧凑的?的原论文方法或结果图
图 1:当前对 CBM 的启发式解释可能不准确,如将生成概念激活 ${\bm{\mathrm{s}}}\in\mathcal{S}$ 的神经骨干模型和具有每类权重 ${\bm{\mathrm{w}}}_{y}$ 的线性推理层与 $y\in[m]$ 相结合的 CBM 所示。左:标准启发式通过查看激活的幅度、权重或两者来计算解释 $\mathcal{E}$,参见。等式。 2. 右:涵盖 $k=2$ 最高权重的启发式解释 $\mathcal{E}$:它证明了两个决策的合理性,即相同的两个激活获得相同的值。然而,决策有所不同:CBM 必须查看 $\mathcal{E}$ 之外的激活来生成它们。因此,$\mathcal{E}$ 不足以完全证明任一决定的合理性。