论文
TRACE:人工智能生成视频检测的轨迹表示和一致性估计
TRACE: Trajectory Representation and Consistency Estimation for AI-Generated Video Detection
摘要
生成视频模型的最新进展使得视觉逼真内容的合成成为可能,这对合成视频检测提出了重大挑战。现有的检测器通常依赖于外观伪影、语义不一致和可能特定于生成器的时间模式,从而限制了对看不见的合成模型的泛化。我们研究对预训练生成模型的反应是否提供了更多可转移的取证线索。我们的主要观察结果是,真实的视频和人工智能生成的视频在预训练的流匹配视频模型下表现出不同的\emph{速度响应}。当不同的预训练视频生成主干用作探针时,这种区别仍然存在,这表明速度响应提供了超越视觉伪像的可传输取证信号。受这一观察的启发,我们提出了 \textbf{TRACE} (\emph{\underline{T}rajectory \underline{R}epresentation \underline{a}nd \underline{C}onsistency \underline{E}stimation}),这是一种用于人工智能生成视频检测的生成过程感知框架。 TRACE 利用预训练的视频 DiT 作为速度场探针来提取多个流时间点的表示,并通过相邻帧之间的速度差异来建模跨帧一致性。我们进一步引入了 \emph{Real-Centered Trajectory Optimization} 目标,该目标鼓励生成器不变表示学习。 AIGVDBench 上的大量实验表明,TRACE 可以有效地推广到不同的生成器,在未见过的开源和闭源视频生成模型上大大优于现有的最先进方法。