论文
不只当玩笑:多角度推理检测与解释梗图中的有害幽默
Beyond a Joke: Multi-Angle Reasoning for Detecting and Explaining Harmful Humor in Memes
摘要
互联网梗图交织视觉线索、文本内容与文化语境,在幽默、讽刺与有害意图并存的场景中尤其难解读。这种复杂性要求可解释的梗图理解系统提供可靠且结构化的推理,以支持准确分类与人类可读的解释。现有多模态分类器要么忽视这些相互依赖,要么仅提供有限的可解释性。本文提出MAR-12,一个利用视觉语言模型(VLM)在幽默与仇恨元素可能共存场景下做梗图检测与理解的新框架。框架先从幽默与仇恨理论导出的十二个结构化视角解读每张梗图,再用角色感知的软门控注意力学习各视角应贡献多少,随后以基于原型的分类器做最终预测;最后结合各视角推理与学到的注意力权重合成解释,保证透明且有语境依据的论证。在PrideMM与Memotion数据集上,MAR-12幽默检测最高达80.3%准确率、仇恨检测达75.9%,优于最先进方法。人类与基于GPT-4的评估均确认MAR-12生成的解释连贯且有说服力,尤其在幽默与有害线索共存的梗图上。