论文
超越字面意义:分解多模态模因理解中的实用意图
Beyond the Literal: Decomposing Pragmatic Intent in Multimodal Meme Understanding
摘要
当被问及模因或讽刺帖子的含义时,大视觉语言模型 (LVLM) 倾向于描述图像显示的内容,而不是作者试图传达的内容。标准的指令调整将帖子的字面内容与其实用含义纠缠在一起,让表面细节污染了最终的回应。我们将 meme 理解重新定义为字面语用分解问题,并提出 \textbf{Intent Projection},这是一个在单个 LVLM 主干中在表示、输出和目标级别上分离两个信号的框架。在表示级别,正交投影模块从融合的图像文本表示中删除主要的单峰方向,仅保留实用残差,而表面真实情感分类器使用命名极性间隙的离散标签来锚定解码器。在输出层面,该模型将结构化推理链具体化,而在客观层面,对比奖励明确惩罚重述字面描述的答案。在六个多模式基准测试中,意图投影始终优于开源基准,并缩小了与专有模型的差距,在高分歧帖子上收益最大,而字面上的崩溃是最具破坏性的。