论文

CaRGo-T:因果推理思维图提高多模态幽默理解

CaRGo-T: Causal Reasoning Graph-of-Thought improves Multimodal Humor Comprehension

模型推理推理策略与问题分解

摘要

大规模视觉语言模型(VLM)在广泛的多模态任务中表现出了卓越的多功能性。然而,理解幽默仍然具有挑战性,因为幽默内容通常取决于实体、事件、上下文以及图像和文本模式之间的隐含关系之间的微妙交互。这些交互可能涉及复杂的推理链,很难通过传统的提示或线性思维链推理来捕获。在这项工作中,我们提出了 CaRGo-T(因果推理图思维),这是一种推理框架,它将多模态幽默背后的因果关系和上下文关系表示为一种轻量级的基于图的推理结构。该图被序列化为由 VLM 生成的基于代码的表示,随后可以由相同或不同的 VLM 进行解释,以在零样本或上下文学习设置中生成最终预测。我们在涵盖不同形式的喜剧内容(包括讽刺、讽刺和模因)的四个数据集上评估了 CaRGo-T 的幽默理解和幽默检测。使用最先进的商业和开源 VLM 进行的实验表明,CaRGo-T 的性能始终优于现有的基于推理的基线,在幽默理解方面实现了大约 1-20% 的增益,在幽默检测方面实现了 1-3% 的增益。使用互信息的进一步分析表明,CaRGo-T 生成的推理表示比基线推理方法生成的推理表示包含更多与目标输出相关的信息。代码可在 https://github.com/abhi1nandy2/CaRGo-T 获取。