论文
BanglaMemeX:利用多模态可解释数据集推进孟加拉语的文化隐喻图像解释
BanglaMemeX: Advancing Cultural Metaphoric Image Interpretation in Bangla with a Multimodal Explainable Dataset
摘要
视觉语言模型在多模态基准上取得了强劲的表现,但它们推理基于文化和隐喻丰富的内容的能力仍然没有得到充分研究。互联网模因呈现出一种具有挑战性的环境,其中意义是从图像、重叠文本、讽刺和共享社会文化知识之间的隐式交互中产生的,而不是字面的视觉识别。这一挑战在孟加拉等资源匮乏的语言中更加严重,其中代码混合、风格化脚本和文化特定的象征主义引入了巨大的分布转变。在这项工作中,我们介绍了 BanglaMemeX,这是一个基于文化的多模式基准,由 3,000 个孟加拉模因组成,并带有多维标签(幽默、讽刺、攻击性、动机意图和整体情绪)以及明确描述文本和视觉隐喻的人工编写解释。我们系统地评估了现代 VLM 的分类和解释生成,揭示了当前的模型尽管具有合理的表面精度,但仍难以解释隐含的文化线索。我们的结果强调了对具有文化意识的多模态系统的需求,该系统能够在语言和文化分布转变下进行基础推理。