论文

注意裂痕:人工智能生成视频检测的跨尺度耦合失配

Mind the Rift: Cross-Scale Coupling Mismatch for AI-Generated Video Detection

AI 基础设施AI安全与内容治理基础设施

摘要

随着人工智能视频生成器实现电影般的真实感,可靠的检测对于维护数字信任变得至关重要。我们将跨尺度耦合失配识别为一种新的取证信号,其中尺度指的是抽象级别(语义动态与像素级残差):在自然视频中,宏观级时间动态和微观级残差模式通过统一成像物理管道本质上耦合,而人工智能生成器的训练目标没有明确保留这种联合分布,系统地违反了这种耦合。检测这种不匹配具有挑战性,因为它需要独立提取两个尺度的信息,同时量化它们的跨尺度关系。我们提出了 RIFT(轨迹表示不一致取证),这是一种正交取证框架,通过三个互锁组件解决了这个问题:宏观流,通过微分几何和学习流形轨迹上的持久同源性构建预期时间演化的动态基线;微流,通过隐写分析过滤和时间建模充当敏感的取证探针;耦合发散模块,测量两个流之间的条件依赖关系。格拉姆-施密特正交性保证了该测量的信息论有效性。两个基准测试(VidProM、120K 视频、7 个生成器;GenVidBench、68K 视频、4 个生成器)的实验表明,RIFT 分别实现了 99.33% 和 99.72% 的 F1 分数,在留一评估中未见生成器检测率为 97.87%,同时表现出编码器不可知论:从 ViT-S/14 进行缩放(22M) 到 ViT-L/14 (300M) 使 F1 变化不到 0.1%,而切换到不同的编码器系列 (DINOv1) 仅使 F1 减少 0.73 pp。代码可在 https://github.com/Litsay/RIFT 上获取。