论文

EVL-MCoT:用于有害模因检测的增强型视觉语言多 CoT

EVL-MCoT: Enhanced Vision-Language Multi-CoT for Harmful Meme Detection

模型推理推理策略与问题分解

摘要

MEME 在互联网上广泛使用,通常带有强烈的讽刺或反讽元素。理解它们隐藏的含义通常需要对文本和视觉进行联合解释。现有方法侧重于双流视觉-语言模型同时提取视觉和文本,缺乏对 MEME 综合解释的背景信息和先验知识。一种可行的选择是采用思想链(CoT)。然而,简单的 CoT 方法缺乏多视角思维,这可能会损害结果答案的可靠性。而且,它往往依赖于浅层特征融合,缺乏局部细节的融合和细粒度的视觉提示文本对齐。这种限制阻碍了对视觉和文本之间复杂联系的更深入的理解。在此,提出了一种增强型视觉语言多CoT(EVL-MCoT)方法来解决这些限制。通过促进多 CoT,EVL-MCoT 增强了决策过程中的一致性并减少了偏差。此外,我们设计了一个原型引导和上下文引导的解码框架,它结合了视觉原型来指导融合过程,并使模型能够更精确地对齐文本和视觉信息。我们在 HatefulMemes 和 MultiOff 数据集上取得了有希望的结果。源代码已公开发布,可在 https://github.com/BGWH123/EVL-MCoT 获取。