论文

MTOR:具有多模态语义和时间超规则性的通用人工智能生成视频检测

MTOR: Generalizable AI-Generated Video Detection with Multimodal Semantics and Temporal Over-Regularity

模型评测安全与风险评测

摘要

视频生成的快速发展缩小了真实视频和合成视频之间的感知差距,使得通用人工智能生成的视频检测变得越来越具有挑战性。现有的检测器主要依赖于视觉表示,而对源自字幕的文本语义的探索还不够。与此同时,细粒度视觉表示中的时间规律性受到的关注有限。我们发现,源自标题的文本表示为全局视觉表示提供了补充的判别线索。我们的分析进一步表明,人工智能生成的视频表现出更强的时间持久性和更低的时间变异性,我们将这种模式称为时间过度规律性(TOR)。基于这些发现,我们提出了具有多模式分支和 TOR 组件的 MTOR。多模态分支集成了全局视觉和字幕衍生的文本表示,而 TOR 组件在三个级别上对时间过度规则性进行建模:粗略的帧间连续性、细粒度的token对应性和帧到视频的稳定性。对涵盖 46 种生成器变体的 5 个基准进行了广泛评估,证明了相对于 16 个代表性基线的最先进的整体性能,而鲁棒性实验则证实了对 12 种现实世界视频扰动的强大弹性。代码和模型将在https://github.com/hwang-cs-ime/MTOR.发布

MTOR:具有多模态语义和时间超规则性的通用人工智能生成视频检测的原论文方法或结果图
图 2:所提出的 MTOR 框架概述,由视频级多模态分支、TOR 组件和源校准分数融合组成。