论文
HarmTrace:用于有害模因中细粒度目标识别的锚定校准解耦优化
HarmTrace: Anchor-Calibrated Decoupled Optimization for Fine-Grained Target Identification in Harmful Memes
摘要
多模式有害模因检测通常被表述为图像-文本有害性分类。模型可能会正确预测危害性,但会错误地识别受攻击的目标或其支持证据。因此,我们通过细粒度的目标识别来扩展有害模因检测,询问什么类型的目标受到攻击、谁是攻击目标以及目标出现在模因中的位置。该模型预测每个模因的危害性,并且对于有害模因,输出目标类别、目标实体、文本提及和视觉区域。为了支持这项任务,我们引入了 Meme3W,它统一了多个公共有害模因数据集,并为有害实例提供经过人工验证的注释。我们进一步引入联合记录准确性(JRA),这是一种严格的记录级指标,要求危害性标签和所有目标识别字段共同正确。代表性多模态 大语言模型 的实验揭示了危害性准确度与 JRA 之间存在巨大差距。为了缩小这一差距,我们提出了 HarmTrace,一种锚定校准的解耦优化框架。 HarmTrace 通过实体感知监督 微调 加强目标实体监管。然后,它应用条件目标识别策略优化(CTPO)来解耦有害性和目标识别优势,将目标识别优化限制为针对有害示例的标签正确响应。 CTPO 使用虚拟正锚 (VPA) 作为目标识别优势标准化的完全正确参考。 HarmTrace 提高了所评估主干上的 JRA 和危害性准确性,Qwen3-VL-8B 主干上的 JRA 从 17.58\% 增加到 52.51\%。我们的代码可在 https://github.com/llly1234/HarmTrace-for-Harmful-Memes 上公开获取。