论文

BabelFake:多语言视听 DeepFake 基准

BabelFake: A Multilingual Audio-Visual DeepFake Benchmark

模型评测基准与评测资源

摘要

可靠且实用的视听 DeepFake 检测需要能够反映不同语言环境的基准以及用于视觉和音频操作的现代数据合成管道。然而,现有的数据集主要包含英语使用者的镜头,通常包含过时的操作类型,或者忽略了音频模式。此外,许多数据集的特征是不同意在 DeepFake 创作中使用的个人。我们推出 BabelFake,这是一种在参与者同意的情况下录制的多语言视听 DeepFake 基准测试。 BabelFake 包含来自 496 个人的 399,000 个剪辑(1,323 小时),涵盖五种语言(英语、德语、意大利语、法语、西班牙语)。我们的模块化数据生成管道将 11 种现代视频操作方法与 4 个语音克隆引擎配对,区分仅视觉(面部交换)和联合视听操作(唇形同步和肖像动画)。通过对最先进的检测器进行基准测试,我们表明检测难度取决于视听生成配对,当保留真实音频时,性能会大幅下降。跨语言/人口统计评估揭示了不同检测器架构和训练数据的灵敏度不同,而人类评估则表明感知的真实性和机器检测难度不一定一致。

BabelFake:多语言视听 DeepFake 基准的原论文方法或结果图
图 2:生成的 BabelFake 基准的组成。 (a) 假样本在五种支持的语言中的分布。灰色条对应于具有真实音频的视频,而阴影条表示具有合成语音的视频。 (b) 生成的样本在三个视频处理类别中的分布。颜色表示与每种操作方法配对的语音合成模型(PL [32]、AF [28]、HP [56]、UG [57]、KS [13]、MT [58]、LS [30]、CS [37]、DLC [19]、HF [55]、IS [54])。换脸方法保留了真实的音频,而肖像动画和唇形同步可用于真实和合成的语音。