论文

学习像漫画配图师一样思考:面向多模态幽默理解的不协调-消解监督

Learning to Think Like a Cartoon Captionist: Incongruity-Resolution Supervision for Multimodal Humor Understanding

模型训练监督微调与指令调优

摘要

幽默是为数不多的认知任务之一:在这类任务中,把推理过程做对与把答案做对同等重要。尽管近期工作在 New Yorker Cartoon Caption Contest(NYCC)等基准上评估幽默理解,但大多将其视为黑盒预测,忽视了幽默理解背后的结构化推理过程。我们提出 IRS(Incongruity-Resolution Supervision),一个将幽默理解分解为三个组件的框架:不协调建模,识别视觉场景中的错位;消解建模,为这些错位构建连贯的重新诠释;偏好对齐,在人类判断下评估候选解释。IRS 以不协调-消解理论与专家配图师实践为基础,通过结构化轨迹监督中间推理过程,使从视觉感知到幽默诠释的路径变得显式且可学习。在 NYCC 上跨 7B、32B 与 72B 模型,IRS 在配文匹配与排序任务上均优于强大的开源与闭源多模态基线,其中我们最大的模型在排序上接近专家级表现。向外部基准的零样本迁移表明,IRS 学到了可泛化的推理模式。我们的结果表明,对推理结构加以监督,而非仅靠规模,才是以推理为中心的任务的关键。

学习像漫画配图师一样思考:面向多模态幽默理解的不协调-消解监督:论文配图
图 1:不一致解决监管 (IRS) 概述。 IRS 将幽默理解建模为包含三个组成部分的结构化推理过程:(1)不协调建模,识别视觉场景中的不匹配; (2) 分辨率建模,对这些不匹配构建连贯的重新解释; (3)偏好对齐,根据人类判断评估候选解释。训练阶段、持续预训练、对字幕推理痕迹的监督学习以及带有接地奖励的强化学习支持这些组件。