论文
DARC-CLIP:具有交叉注意力的动态自适应细化用于模因理解
DARC-CLIP: Dynamic Adaptive Refinement with Cross-Attention for Meme Understanding
摘要
模因通过视觉和文本信号的交互来传达意义,通常以微妙的方式结合幽默、讽刺和冒犯。检测模因中的有害或敏感内容需要对这些多模式线索进行准确建模。现有的基于 CLIP 的方法依赖于静态融合,这很难捕获模态之间的细粒度依赖关系。我们提出了 DARC-CLIP,这是一种基于 CLIP 的框架,用于具有分层细化堆栈的自适应多模态融合。 DARC-CLIP 引入了用于双向信息对齐的自适应交叉注意力优化器和用于任务敏感信号自适应的动态特征适配器。我们在 PrideMM 基准上评估 DARC-CLIP,其中包括仇恨、目标、立场和幽默分类,并在 CrisisHateMM 数据集上进一步测试泛化。 DARC-CLIP 在跨任务中实现了极具竞争力的分类准确性,在仇恨检测方面比最强基线显着提高了 +4.18 AUROC 和 +6.84 F1。消融研究证实 ACAR 和 DFA 是这些收益的主要贡献者。这些结果表明,自适应交叉信号细化是社会敏感分类中多模态内容分析的有效策略。