论文
迈向细粒度语音修复取证:多区域篡改定位的数据集、方法和指标
Toward Fine-Grained Speech Inpainting Forensics:A Dataset, Method, and Metric for Multi-Region Tampering Localization
摘要
语音克隆和文本到语音合成的最新进展使得部分语音操纵(对手替换话语中的几个单词以改变其含义,同时保留说话者的身份)成为越来越现实的威胁。现有的音频深度伪造检测基准侧重于话语级二元分类或单区域篡改,在检测和定位数量先验未知的多个修复片段方面存在关键差距。我们通过三项贡献来解决这一差距。首先,我们介绍 MIST(多区域修复语音篡改),这是一个跨越 6 种语言的大规模多语言数据集,每个话语有 1-3 个独立修复的词级片段,通过 LLM 引导的语义替换和神经语音克隆生成,每个话语的虚假内容仅占 2-7%。其次,我们提出了 ISA(迭代分段分析),这是一个与骨干网无关的框架,它通过间隙容忍区域提议和边界细化来执行从粗到细的滑动窗口分类,以恢复所有被篡改的区域,而无需事先了解其计数。第三,我们定义了 SF1@tau,一个基于时间 IoU 匹配的分段级 F1 度量,联合评估区域计数精度和定位精度。零样本评估表明,现有的深度造假检测器仍然无法解决单词粒度上的部分修复问题:在完全合成的语音上训练的话语级分类器为 MIST 话语分配接近零的假概率,其中只有 2-7% 的内容被操纵。在这种具有挑战性的环境中,ISA 始终优于非迭代基线,并且数据集、代码和评估工具包都是公开发布的。