论文

REIMU:基于 SSL 的语音 Deepfake 检测的高效异构分层推理

REIMU: Efficient Heterogeneous Hierarchical Reasoning for SSL-Based Speech Deepfake Detection

模型评测模型能力评测

摘要

文本到语音和语音转换系统生成的语音越来越真实,对媒体完整性和语音身份验证提出了越来越大的挑战。自监督学习 (SSL) 具有非常先进的语音深度伪造检测功能,其中下游主干通常通过单个前向传递处理 SSL 表示。这项工作研究了循环分层推理对于该任务的实际有效性。我们将这项对照研究称为 REIMU,并系统地比较了四个 Base-scale SSL 前端的传统单通道主干、权重共享循环、同质 HRM 和异构 HRM。我们进一步研究了将自注意力与线性注意力相结合的异构高层和低层模块。 ASVspoof 2019 和 2021 评估集上的实验表明,递归和分层分解本身并不能改善检测,而异构算子分配则提供了更具竞争力的配置。值得注意的是,异构设计仍然具有竞争力,同时使用比匹配基线少 10.8% 的下游参数,这证明了其参数高效的语音深度伪造检测的潜力。