论文
XPlainVerse:可解释的 Deepfake 检测的百万级基准
XPlainVerse: A Million-Scale Benchmark for Explainable Deepfake Detection
摘要
随着深度造假检测模型越来越多地产生自然语言解释,它们的推理通常仍然缺乏视觉伪影的证据依据,从而限制了可靠性和用户信任。现有的基准主要评估分类准确性,忽略解释是否反映实际操作。这一差距阻碍了可部署、可解释的深度伪造检测系统的进展。为此,我们引入了 XPlainVerse,这是一个专为联合 Deepfake 检测和以人为中心的解释而设计的大型基准。 XPlainVerse 包含一百万张真实和经过处理的图像,将来自五个既定来源的真实图像与十二个现成的图像编辑和合成模型生成的伪造图像配对。我们进一步提出了一个多级过滤管道“编辑检查”,以验证操作是否满足其预期编辑,从而实现大规模可靠的推理监督。除了数据集规模之外,XPlainVerse 还提供两种互补的解释风格:用于专家分析的技术解释和针对非技术用户优化的简化解释。为了评估超越表面相似性的解释质量,我们提出了新的指标 EntityScore 和 EvidenceScore,它们通过检查解释是否正确识别被操纵的实体和视觉证据来衡量推理保真度。对 2,000 个解释对的人工注释根据人类判断验证了我们的数据集质量。我们相信 XPlainVerse 将建立扎根的解释质量作为深度伪造检测的可衡量维度,并支持对可信赖、可解释模型的可扩展研究。