论文

采用强化学习和思想链监督来可解释地检测仇恨和宣传模因

Adapting Reinforcement Learning with Chain-of-Thought Supervision for Explainable Detection of Hateful and Propagandistic Memes

模型训练强化学习

摘要

仇恨和宣传模因利用图像和文本之间的相互作用来传达两种形式单独揭示的有害意图。尽管基于思维的多模态 大语言模型 (MLLM) 具有先进的视觉语言理解能力,但它们在模因内容审核中的应用仍未得到充分探索。我们提出了一种基于强化学习的 后训练 方法,该方法通过特定于任务的奖励和组相对策略优化(GRPO)来提高基于思维的 MLLM 中的分类性能和基于参考的解释质量。具体来说,我们(i)对现成的 MLLM 进行了系统的实证研究,以理解英语和阿拉伯语基准中的仇恨和宣传性模因,(ii)通过 蒸馏 和多 LLM 细粒度宣传注释,用弱监督思想链(CoT)原理扩展现有模因数据集,(iii)引入基于 GRPO 的目标思维长度正则化,共同优化分类准确性和解释质量,以及(iv)使用基于共识的伪标签研究对未标记模因的自我监督 GRPO。 Hateful Memes 和 ArMeme 基准测试表明,我们的方法比之前报告的 FHM 准确度(从 79.9% 到 82.0%,高达 +2.1%)和 ArMeme Macro-F1(从 0.536 到 0.612,带解释,高达 +7.6 分;与原始 ArMeme 基准相比 +6.1)的结果有所改进,同时还生成自然语言解释。在 ArMeme 上,序列分类基线在原始准确性方面仍然更强,而我们的方法提供了更平衡的每类性能以及解释。我们公开发布我们的代码、数据扩展和评估资源。