论文
DETECT-3B-Omni 与内容和人口统计无关
DETECT-3B-Omni is Agnostic of Content and Demographics
摘要
值得信赖且符合 GDPR 的深度伪造音频检测器必须根据声学伪影做出决策,而不是根据所说的内容或说话的人。我们针对 Resemble AI 的检测器 DETECT-3B-Omni 进行了大规模的语义独立性研究。我们使用来自 30 个州的不同美国英语使用者的 10,240 个音频样本(通过 8 个不同的 AI 语音克隆系统生成)来测试检测准确性是否取决于语音内容(善意与恶意)、说话者性别、说话者年龄或说话者区域。使用等效性测试,我们的结果表明,在 99% 的置信度下,这两个组之间的准确度差异最多为 2 个百分点。因此,无论音频说什么或说话者是谁,检测器都能以同等的精度识别人工智能生成的音频。