论文
从廉价伪造到纯合成:应对T2V虚假新闻视频的新时代
From Cheap Fakes to Pure Synthesis: Addressing the New Era of T2V Fake News Videos
摘要
近期的文本生成视频(T2V)模型使虚假新闻视频能够从零合成,将威胁扩展到由现有片段拼凑的廉价伪造(cheap fakes)之外。这类新闻视频可以紧密匹配虚构叙事,为现有检测器制造模态对齐陷阱。现有数据集缺乏纯合成虚假新闻视频。虽然直接用虚假新闻视频描述提示T2V模型可以获得完美对齐的样本,但这会将虚假新闻视频检测(FNVD)简化为单模态捷径,并导致语义-视觉退化。为此,我们将T2V-FNVD形式化为一个新的三分类任务,包含三个标签(真实、廉价伪造与纯合成虚假),并构建了首个纯合成虚假新闻视频数据集(PS-FNVD)。PS-FNVD包含带有对齐欺骗的虚构事件(类型1)与带有虚假视觉出处的真实事件(类型2),防止模型利用单模态捷径。此外,我们提出推理引导的T2V-FNVD(R-T2V)框架。R-T2V通过条件化理由生成与监督微调训练,将高层语义逻辑与低层物理生成痕迹相结合以预测三分类真实性标签。在10个主流基线上的大量实验表明,R-T2V取得最先进性能,准确率超过第二名基线12.20个百分点,宏F1超过8.46个百分点。
