论文
BabelFake:多语言视听 DeepFake 基准
BabelFake: A Multilingual Audio-Visual DeepFake Benchmark
摘要
可靠且实用的视听 DeepFake 检测需要能够反映不同语言环境的基准以及用于视觉和音频操作的现代数据合成管道。然而,现有的数据集主要包含英语使用者的镜头,通常包含过时的操作类型,或者忽略了音频模式。此外,许多数据集的特征是不同意在 DeepFake 创作中使用的个人。我们推出 BabelFake,这是一种在参与者同意的情况下录制的多语言视听 DeepFake 基准测试。 BabelFake 包含来自 496 个人的 399,000 个剪辑(1,323 小时),涵盖五种语言(英语、德语、意大利语、法语、西班牙语)。我们的模块化数据生成管道将 11 种现代视频操作方法与 4 个语音克隆引擎配对,区分仅视觉(面部交换)和联合视听操作(唇形同步和肖像动画)。通过对最先进的检测器进行基准测试,我们表明检测难度取决于视听生成配对,当保留真实音频时,性能会大幅下降。跨语言/人口统计评估揭示了不同检测器架构和训练数据的灵敏度不同,而人类评估则表明感知的真实性和机器检测难度不一定一致。
