VendorBench-100:Deepfake 图像检测的统一跨范式基准
VendorBench-100: A Unified Cross-Paradigm Benchmark for Deepfake Image Detection
摘要
Deepfake 图像检测由三种根本不同的范例提供服务——商业 API、零样本视觉语言模型 (LLM) 和开源检测器——这些范例很少在通用协议下进行评估,这使得直接比较变得困难。我们引入了 VendorBench-100,这是一个跨范式基准测试,它使用单个对抗性 100 图像语料库、统一的输出模式和通用评估框架来评估 36 个代表性模型。模型主要根据 Matthews 相关系数 (MCC) 进行排名,ROC-AUC 被报告为与阈值无关的排名能力度量。它没有最大化尺寸,而是通过八种边缘情况系列的分类来强调现实世界的困难,例如面部交换、文本到视频静态、人工智能照片编辑、头像合成、不透明来源图像和压缩研究框架。商业 API 实现了最强的中值性能,其次是视觉 LLM 和开源检测器,尽管个别开源模型仍然与最好的 LLM 具有竞争力。在所有 36 个模型中,MCC 和 ROC-AUC 强相关(Pearson r ~ 0.86);更重要的发现是更狭窄和单向的:原本强大的排名器的子集在其出厂默认阈值上被错误校准,因此高 ROC-AUC 可能夸大了现实世界的可部署性。另外,原始准确率和 F1 在该语料库不平衡的类别划分上是不可靠的,因为不加区别地预测“假”的模型在这两个方面都取得了欺骗性的好成绩,同时没有提供真正的区分技能。没有任何单一指标是孤立安全的:MCC 和特异性应始终伴随着 ROC-AUC 和准确性。我们发布了完整的评估框架和结果。代码和数据:https://github.com/sharayu-20/vendorbench-100