论文
Pando:当模型无法自我解释时,可解释性方法是否有效?
Pando: Do Interpretability Methods Work When Models Won't Explain Themselves?
摘要
机械可解释性通常是出于一致性审核的目的,其中模型的口头解释可能不存在、不完整或具有误导性。然而,许多评估并不能控制黑盒提示是否能够单独恢复目标行为,因此白盒工具的明显收益可能反映的是启发而不是内部信号;我们称之为启发混杂因素。我们引入了 Pando,一个模型有机体基准,它通过解释轴打破了这种混乱:模型被训练来产生对真实规则的忠实解释、没有解释,或者对不相交干扰规则的自信但不忠实的解释。在实现隐藏决策树规则的 720 个微调模型中,代理从 10组带标签的查询响应对中预测保留的模型决策,并可选择使用一种可解释性工具输出进行增强。当解释忠实时,黑盒启发可以匹配或超过所有白盒方法;当解释不存在或具有误导性时,基于梯度的归因可将准确性提高 3-5 个百分点,而相关性修补、RelP 会带来最大的收益,而 logits 透镜、稀疏自动编码器和电路跟踪则无法提供可靠的好处。方差分解表明梯度跟踪决策计算,这些字段因果地驱动输出,而其他读数则由任务表示主导,偏向字段标识和值。我们发布所有模型、代码和评估基础设施。