AI 生成视频检测中的审核泛化:六控制协议和 VidAudit 工具包
Auditing Generalization in AI-Generated Video Detection: A Six-Control Protocol and the VidAudit Toolkit
摘要
人工智能生成的视频检测基准(例如 GenVidBench 和 AIGVDBench)是事实上的排行榜,但大多数评估协议留下了不受控制的混杂因素,可能会夸大报告的概括性。作为存在性证明,在未经审计的评估下,三特征剪辑长度分类器在 GenVidBench 上达到了 0.998 的留一生成器 (LOGO) AUC,同时不测量任何有关运动的信息。一项 20 篇论文的调查发现,没有一个应用所有六种标准控制来捕获这一点,因此我们将它们组合成一个经过审计的协议,并将其应用于六个代表性特征源(三个已发布的检测器和三个重新利用的信号源),在 AIGVDBench 上跨数据集重新运行它。审计既揭穿又证明了:平凡分类器崩溃到接近机会 (0.529),CLIP 基线被发现携带数据集身份,2025 年取证检测器 WaveRep 清除了分布外 LOGO AUC 0.996 的地板,具有机会级别的真实与真实的一致性。在可部署的 FPR 为 0.1% 时,多种高 AUC 方法会下降到单位数召回率,并且排行榜顺序会发生变化,因此我们建议对单个数字使用经过审计的元组(AUC、上限值、操作点召回率和校准)。作为白盒阳性对照,我们添加 TemporalSpec(编解码器运动向量);通过跨基板特征融合(XSFF),第二个基板增加了真正的互补性,从而通过了审核。我们发布了 VidAudit,据我们所知,这是针对此任务的最大的统一和经过审核的检测器集合,它在一个插件 API、排行榜和 Croissant 元数据背后提供了 14 个检测器,可在 https://github.com/KurbanIntelligenceLab/vidaudit 上获取。该协议和工具包共同将评估从排行榜排名转向结果是否衡量其声称的内容。