论文

在判断之前先学习:渐进式知识到决策的调整,用于可解释的仇恨模因检测

Learn Before You Judge: Progressive Knowledge-to-Decision Alignment for Explainable Hateful Meme Detection

模型训练监督微调与指令调优

摘要

仇恨模因通过图像和文本之间的隐式交互传播辱骂内容,对在线社区的安全构成严重威胁。近年来,多模态大语言模型已广泛用于仇恨模因检测,并越来越多地用于生成可解释的检测结果。然而,我们发现现有的解释然后检测方法通常在同一训练过程中结合解释生成和标签预测。这种耦合会导致任务目标之间的干扰,导致检测性能有限,甚至比简单的 SFT 基线更糟糕的结果。为了应对这些挑战,我们提出了 ProKDA,一种渐进式知识到决策对齐方法,用于可解释的仇恨模因检测。受人类注释训练过程的启发,ProKDA 首先使用代理背景知识构建管道来获取与模因理解相关的外部知识。然后采用三阶段训练策略,依次进行背景知识学习、仇恨检测学习和仇恨边界对齐。与之前联合优化两项任务的“解释然后检测”方法不同,ProKDA 在每个阶段专注于单个训练目标。这种设计减少了两个任务之间的干扰,并逐步将背景知识转化为稳健的检测决策。对三个公共仇恨模因基准的实验表明,ProKDA 实现了最先进的检测性能,并为仇恨模因调节提供了准确、可解释且有证据支持的决策。项目页面:https://meizhiyuan88666.github.io/prokda。