论文
FBHM:用于仇恨模因检测的 VLM 功能基准测试和指导
FBHM: Functional Benchmarking and Steering of VLMs for Hateful Meme Detection
摘要
仇恨模因检测对于视觉语言模型来说仍然是一个巨大的挑战,因为现有的基准在结构上是观察性的——将修辞仇恨机制与目标社区特征混为一谈,并阻碍了对模型漏洞的因果评估。为了解决这个问题,我们引入了 FBHM,这是一个系统策划的基于功能的仇恨模因的基准,沿着两个正交轴构建:25 个不同的修辞功能和 10 个目标社区(总共 5,000 个模因)。对最先进的 VLM 进行基准测试揭示了严重的泛化差距:在标准数据集上高度准确的模型在 FBHM 上灾难性地下降到接近随机的性能,证明它们利用了数据集特定的启发式方法,而不是强大的多模态推理。为了有效缩小这一差距,我们提出了 LSV(可学习转向向量),这是一种超低数据机制策略,该策略对少至 500 个转向样本(50 个独特的基本模因)应用因果干预目标,将 FBHM 性能提高约 30 个 Macro-F1 点,同时优于上下文学习和 PEFT,而不会降低源域性能。