论文
VidForensics-M1:具有可验证时间基础的元检测强化学习,用于人工智能生成的视频取证
VidForensics-M1: Meta-Detection Reinforcement Learning with Verifiable Temporal Grounding for AI-Generated Video Forensics
摘要
视频生成模型的最新进展显着提高了合成视频的真实感,模糊了生成内容和真实内容之间的界限,并引发了对错误信息的担忧。现有的基于 MLLM 的检测器主要依赖于有监督的 微调 或标签级强化学习,其中粗略的监督限制了对未见过的场景和新兴视频生成器的泛化。为了克服这些限制,我们第一个将 \textbf{meta-detection} 引入人工智能生成的视频检测中,通过联合优化预测标签和强化学习中的支持证据来实现可靠的伪造检测。这种范式需要可靠的证据信号和有效的机制将它们集成到标签级优化中。文本原理提供了伪造制品的语义描述,但它们的生成和验证依赖于外部模型,使得监督容易受到幻觉和语义偏差的影响。相比之下,时序定位提供了更客观和可验证的证据,因为在伪造过程中可以精确控制操纵间隔。基于这一见解,我们提出了一种自动化数据构建管道,通过用边界帧条件视频生成模型替换时间段来生成配对的真假视频。此外,我们引入了 \textbf{Evidence-Guided Reward Redistribution},它通过根据证据质量在标签正确的响应之间重新分配奖励来执行证据感知的信用分配。这保留了可靠的标签监管,同时鼓励检测器获得细粒度和可验证的伪造定位能力。大量实验表明,\textbf{VidForensics-M1} 有效地利用可验证的时间证据来实现鲁棒且可泛化的人工智能生成视频检测。