论文

CORE:面向通用多模态操纵检测的冲突导向推理

CORE: Conflict-Oriented Reasoning for General Multimodal Manipulation Detection

模型训练监督微调与指令调优

摘要

生成式人工智能的快速崛起使得多模态假新闻变得越来越现实和普遍,对公众信任和社会稳定构成严重威胁。现有的检测方法严重依赖于特定于操作的模型和大规模标记数据,导致对新兴操作类型的泛化能力较差。我们观察到,被操纵的错误信息的本质在于其内在的冲突,即跨模态或与共同世界知识的语义或物理不一致。受这一观察的启发,我们提出了 \textbf{C}onflict-\textbf{O}riented \textbf{RE}asoning (\textbf{CORE}) 框架,这是一种有效的范式,可以学习赋予多模态大语言模型(MLLM)明确的冲突捕获能力。为此,CORE首先构建了冲突归因语料库(CAC),对冲突因素和来源进行细粒度标注,为后续的冲突感知训练提供必要的数据支持。通过基于 CAC 进行面向冲突的表示增强和推理,CORE 实现了鲁棒且可泛化的冲突检测,有效且快速地适应少量样本甚至零样本设置中未见的操作类型。大量实验表明,CORE 超越了最先进的模型。数据集和代码可在 https://github.com/shen8424/CORE 公开获取。

CORE:面向通用多模态操纵检测的冲突导向推理:论文配图
图 1:虽然以前的方法需要大量数据和针对特定操作的专门设计,但它们在处理新类型时遇到了困难。我们的核心解决了假新闻中的核心“冲突”,以最少的数据实现广义检测和卓越性能。 “玛尼。”意思是“操纵”