论文
SpecSem-Net:集成光谱和语义特征以实现强大的人工智能生成视频检测
SpecSem-Net: Integrating Spectral and Semantic Features for Robust AI-generated Video Detection
摘要
最近的商业视频生成模型(例如 Sora 和 Veo)具有出色的视觉保真度,这使得强大的人工智能生成视频检测变得越来越重要,以防止合成内容与真实视频无法区分并被利用来传播虚假信息。然而,现有的检测器经常由于过度依赖日益现实的语义特征而忽视微妙的光谱伪影而失败。在本文中,我们提出了 SpecSem-Net,这是第一个引入语义引导频谱去噪机制的框架,专门用于高保真人工智能生成的视频检测。具体来说,我们设计了一个频谱模块,通过基于傅里叶变换的滤波来提取高频特征。此外,为了减少频谱噪声引起的误判,我们采用门控合并机制自适应地融合语义上下文,有效减轻频谱噪声。此外,为了评估探测器在最新顶级生成模型上的性能,我们构建了一个由 5 个 SOTA 商业生成器组成的综合基准。大量实验表明,SpecSem-Net 优于现有方法,在我们的基准数据集和公共数据集上分别实现了 87.25% 和 95.59% 的准确率。