论文
可察觉与否?诊断语音 Deepfake 归因的被动指纹
Perceptible or Not? Diagnosing Passive Fingerprints for Speech Deepfake Attribution
摘要
被动指纹(生成器自然留下的内在痕迹)已被证明可以在语音深度伪造检测中实现归因,但其持久性、可重复性和内容独立性尚未得到验证。此外,之前的工作还没有区分可察觉的指纹和不可察觉的指纹,尽管两者对归因可靠性有非常不同的影响。可感知的指纹,例如情感表达,是由感知质量目标决定的,并且可能会随着模型更新而变化,而不可感知的指纹并没有通过当前的训练目标明确优化,并且在现有的数据集设计或训练策略中很少考虑,因为它们对下游应用程序的影响有限。因此,我们提出了可感知-不可感知被动指纹诊断协议(PIPDP)来定义和单独分析这两种指纹类型。 PIPDP 包括三个补充分析:通过残余能量、再现性和显着性分析进行多证据指纹验证,保持音频质量的感知透明扰动,以及无需模型重新训练即可修改可感知指纹的提示驱动情绪变化。十个语音生成器和三个归因检测器的实验表明,难以察觉的指纹提供了持久的归因线索。感知透明的扰动使 HiggsAudioV3 上的归因准确度降低了 48.2%,而情绪驱动的变化使归因基本保持不变,在使用 w2v-bert-MLP 的 CosyVoice2 上,情绪之间的准确度变化只有约 1.0%。这些结果表明,难以察觉的指纹对于可信归因来说更可靠。