论文
当 EER 隐藏部署失败时:审核语音 Deepfake 检测器的阈值传输和未标记分数校准
When EER Hides Deployment Failure: Auditing Threshold Transfer and Unlabeled Score Calibration for Speech Deepfake Detectors
摘要
语音深度伪造对策 (CM) 几乎完全通过等错误率 (EER) 进行比较,EER 是在标记测试集上选择的预言阈值计算的指标。已部署的 CM 不享受这样的预言:必须提前确定阈值并将其应用于未标记的目标数据。我们使用在 ASVspoof 2019 LA 上训练的最先进的 SSL-AASIST 检测器来审核这一差距。虽然其域内 EER 为 0.21%,但将其 LA 校准阈值转移到 In-the-Wild 语料库会产生 39.5% 的一半总错误率 (HTER),其中 78.7% 的真实语音被拒绝,尽管 In-the-Wild EER (11.2%) 看起来适中。然后,我们测试流行的未标记测试时间校正是否缩小了这一差距,并首先证明一个简单的命题:任何严格增加的分数变换,包括 z 范数、温度/位移校准和冻结线性头下的嵌入均值对齐,都不能改变 EER。对 In-the-Wild 和 ASVspoof 2021 DF 的 7 项修正的审核从经验上证实了这一命题,并揭示了两种进一步的失败模式:未标记目标队列的 AS 范数崩溃(EER 11.2% 至 60.2%),而伪标签校准相对于 In-the-Wild 降低了 38% 的 HTER,在 DF21 上退化为 50% HTER,其欺骗先验为96%。没有经过审计的修正可以使 EER 相对降低超过 1%。我们建议按照转移阈值与 EER 一起报告 HTER。