论文
概念瓶颈模型解释何时是忠实且紧凑的?
When Are Concept Bottleneck Model Explanations Faithful and Compact?
摘要
概念瓶颈模型 (CBM) 是神经分类器,允许通过高级概念解释其决策,从而有可能实现理解、引导和调试。然而,他们的解释通常是启发式得出的。基于正式的可解释性,我们认为它们也应该是忠实的,即不误报哪些概念真正重要。我们表明,对于广泛的 CBM 架构,包括最近基于VLM的变体,忠实的解释必须包括瓶颈中的所有概念,当瓶颈很大时,会损害可解释性。这个结果适用于启发式和忠实构造的形式解释。为了鼓励紧凑忠实解释的存在,我们建议 i)将概念概率建模为二元或分类随机变量(而不是 logits),以及 ii)通过组套索(而不是常规弹性网络)采用每个概念训练时间稀疏化。我们还将算法从形式可解释性扩展到 CBM,并表明它们在保证和解释大小方面优于自然启发法。总体而言,我们的工作对天真的可解释性主张提出了警告,并提供了正式条件和实用策略,以确保 CBM 与所宣传的一样可解释。
