论文

手工制作的提示何时以及为何有助于自我监督的反欺骗?因果分析和 忠实性 分析

When and why do handcrafted cues help self-supervised anti-spoofing? A causal and faithfulness analysis

模型评测模型行为与机制分析

摘要

现在,大多数欺骗对策都在自监督 (SSL) 语音编码器之上放置了一个轻型分类器。越来越多的工作添加了手工制作的声学特征,并通过交叉注意力将它们融合在一起,部分原因是注意力权重似乎可以解释模型所依赖的线索。关于这种融合的两件事尚未经过测试:一旦强大的 SSL 编码器就位,手工制作的特征是否会有所贡献,以及注意力图是否忠实地反映了分类器实际使用的内容。我们使用 MOSAIC 研究这两个问题,这是一个单一模型,通过将 152 维生物语音向量投影到参与 WavLM-Large 超过 13 个中间层的 6 个查询标记中来处理逻辑访问 (LA) 和物理访问 (PA) 攻击。我们没有追求最先进的准确性,而是将模型本身视为分析对象,并应用推理时间干预将选定的组件归零。删除手工制作的分支会在 LA 下将 EER 降低 0.67 个百分点,因此单独使用 WavLM 就足够了,但在 PA 下将 EER 提高了 0.76 个百分点,其中分支提供了编码器不携带的重放通道证据。 6x13 注意力图在重采样下高度稳定(引导等级相关性 0.99),但其 忠实性 因领域而异:层注意力权重预测 PA(rho = +0.62)下每层的因果重要性,但不能预测 LA(rho = -0.28)下的因果重要性。因此,手工制作的分支及其基于注意力的解释对于重放攻击来说是值得信赖的,而不是对于合成攻击来说是值得信赖的。在标准基准测试中,该模型在 LA 上处于中等水平,并且领先于跨源 Deepfakes 的官方基准(ASVspoof 2021 DF 上的 EER 为 6.21%)。其贡献不是一个新的架构,而是一个检查程序:在信任之前通过干预来验证手工制作的线索和注意力图。