论文

AnyBottle:保留真正需要概念的紧凑解释

AnyBottle: A Recipe to Only Keep the Concepts You Really Need

模型评测模型行为与机制分析

摘要

概念瓶颈模型 (CBM) 通过人类可解释的概念来路由预测,从而使预测变得可检查和可干预,但最初需要概念注释。无注释变体消除了这一要求,但通常使用大型概念词汇表,在训练和推理中都是静态的,产生比任何任务或预测需求都大的瓶颈,并且更难以检查。我们提出了 AnyBottle,这是构建紧凑的、特定于任务的 CBM 的单一方法。 AnyBottle 仅假设一个冻结的 骨干模型 和一个无监督的概念池,例如稀疏自动编码器。然后,在相同的 骨干模型 上训练的黑盒 教师模型 会指导选择:每一轮都添加最能解释瓶颈当前故障的概念,候选者仅限于 教师模型/学生模型 分歧的区域。在此选择顺序上使用嵌套 dropout 进行训练,最终瓶颈可以从任何概念前缀准确预测,因此推理在早期有信心的输入上花费更少的概念,而在困难的输入上花费更多。由于没有阶段是特定于模态的,因此新的域和任务只需要交换 骨干模型 和概念池。在六个视觉和两个文本数据集以及两个 教师模型 范例中,AnyBottle 产生的瓶颈比无注释基线更少的概念和更高的概念一致性,同时保持接近黑盒参考。总体而言,AnyBottle 表明,无注释并不意味着规模变大:一个小的、发现的词汇可以与一个大得多的固定词汇一样具有表现力。

AnyBottle:保留真正需要概念的紧凑解释:论文原图
图 2:AnyBottle 概述。输入 $x$ 由冻结的 骨干模型 $g$ 编码为 token 嵌入 $z^{\ell}$,稀疏自动编码器 $a$ 映射到概念激活 $c^{\ell}$。每轮选择重复四个步骤:(1)前向传递 教师模型、$f_{T}$ 和当前的 学生模型、$f_{\mathcal{S}}$; (2) 教师模型 输入的属性; (3)由此产生的教师模型/学生模型盲点(绿色),用于将SAE限制在盲点token上; (4) 根据 教师模型 的输出 $Y_{T}$,通过最小二乘残差 $R$ 对结果候选进行评分,以选择下一个概念 $j^{\star}$,添加到 $\mathcal{S}$。重复此过程,直到选择收敛于 $\mathcal{S}^{\star}$。一旦选择终止,(5) 最终预测器 $f$ 在具有嵌套 dropout 的重新缩放的 $\tilde{C}_{\mathcal{S}^{\star}}$ 上进行一次训练,产生一个可以根据任何概念前缀准确预测的头。