论文

RTCFake:实时通信中的语音 Deepfake 检测

RTCFake: Speech Deepfake Detection in Real-Time Communication

模型评测基准与评测资源

摘要

随着语音生成技术的快速进步,实时通信(RTC)场景中语音深度造假带来的威胁日益加剧。然而,现有的检测研究主要集中在离线模拟上,难以应对 RTC 传输过程中引入的复杂失真,包括未知的语音增强过程(例如噪声抑制)和编解码器压缩。为了应对这一挑战,我们提出了第一个针对 RTC 场景定制的大规模语音 Deepfake 数据集,称为 \textit{RTCFake},总计约 600 小时。该数据集是通过多个主流社交媒体和会议平台(例如Zoom)传输语音构建的,可以实现离线和在线语音的精确配对。此外,我们提出了一种音素引导的一致性学习(PCL)策略,该策略强制模型学习平台不变的语义结构表示。本文将RTCFake数据集分为训练集、开发集和评估集。该评估集还包括未见过的RTC平台和未见过的复杂噪声条件,从而为语音深度伪造检测提供了更现实且更具挑战性的评估基准。此外,所提出的 PCL 策略在跨平台泛化和噪声鲁棒性方面实现了显着改进,提供了有效且可泛化的建模范例。 \textit{RTCFake} 数据集在 {https://huggingface.co/datasets/JunXueTech/RTCFake} 中提供。