论文

UNMASK:发现并因果验证文本分类器中的虚假快捷方式

UNMASK: Discovering and Causally Verifying Spurious Shortcuts in Text Classifiers

模型评测模型行为与机制分析

摘要

在大型众包语料库上训练的神经语言模型经常利用与目标标签相关的虚假表面模式,而没有真正的语言或因果相关性,从而提高基准性能,但在对抗性或分布外输入方面失败。现有方法要么需要手动指定特征词汇表,要么仅部分自动发现,从而导致数据集级关联和模型级利用之间的差距无法解决。我们提出了 UN MASK,这是一个完全自动化的管道,可以发现、因果验证和减轻文本分类器中的虚假相关性,而无需额外的人工注释。给定未标记的训练示例,UN MASK 生成候选表面模式作为可执行布尔表达式,通过具有独立复制的统计验证协议对其进行过滤,并通过经过验证的反事实干预建立因果模型依赖性。然后,因果确认的特征可用作深度特征重新加权的无注释组定义,从而消除标准 DFR 所需的组标签。应用于在 MNLI 上训练的 BERT 和 RoBERTa,我们的管道独立地重新发现了已建立的词汇重叠和否定偏差,验证了 BERT 上 10 个特征中的 9 个和 RoBERTa 上的 6 个,并将 HANS 准确度提高了 12.58 个百分点。在 CivilComments-WILDS 上,编程组与手工标记的 DFR 的 70.1% 最差组准确度相匹配(Kirichenko 等人, 2023)没有人口统计注释。我们进一步证明发现和验证阶段可推广到奖励模型偏好数据,在 RewardBench2 中呈现可解释的虚假相关性。