论文

哪些设计改善多模态虚假信息检测:3,375 次受控实验

What Improves Multimodal Misinformation Detection? Answers from a Large-Scale Empirical Study

模型评测模型能力评测

摘要

多模态错误信息越来越多地通过将文本声明与似乎“证明”它的图像配对来看起来令人信服。然而在实践中,构建有效的探测器通常取决于一小部分设计选择,而这些设计选择很少以受控方式进行检查。在本文中,我们对错误信息检测的多模式设计选择进行了大规模研究,进行了超过 3,375 次实验,涵盖三个基准数据集和广泛的预训练视觉和语言主干。通过系统比较和有针对性的鲁棒性分析,我们提炼出实用指南,了解哪些设计选择有帮助、何时会悄无声息地失败,以及管道的哪些方面最能强烈地塑造模型行为,从而回答 4 个关键研究问题 (RQ)。我们的目标是为设计更强大、更可靠的多模式错误信息检测系统提供可靠的基础,从而为更广泛的研究社区做出贡献。

多模态虚假信息检测实验中使用的图像与文本早期融合架构。
图1(图注摘要):多模态虚假信息检测实验中使用的图像与文本早期融合架构。