论文
MemeLens:面向迷因的多语言多任务VLM
MemeLens: Multilingual Multitask VLMs for Memes
摘要
模因是在线交流和操纵的主要媒介,因为意义是从嵌入文本、图像和文化背景之间的相互作用中产生的。现有的模因研究分布在不同的任务(仇恨、厌女症、宣传、情感、幽默)和语言中,这限制了跨领域的泛化。为了解决这一差距,我们提出了 MemeLens,这是一种用于模因理解的统一多语言和多任务解释增强视觉语言模型 (VLM)。我们整合了 38 个公共 meme 数据集,过滤并映射了数据集特定的标签,形成一个包含 20 美元任务的共享分类,涵盖危害、目标、比喻/务实意图和影响。我们提出了跨建模范式、任务类别和数据集的全面实证分析。我们的研究结果表明,强大的模因理解需要多模态训练,在语义类别之间表现出巨大的差异,并且当模型在单个数据集上进行微调而不是在统一的环境中进行训练时,仍然对过度专业化敏感。我们将向社区公开提供实验资源和数据集。
