论文
文化感知幽默图像描述:跨文化背景的多模式幽默生成
Culture-Aware Humorous Captioning: Multimodal Humor Generation across Cultural Contexts
摘要
最近的多模态 大语言模型 在为图像生成幽默图像描述方面表现出了良好的能力,但它们仍然缺乏对明确文化背景的稳定控制,使得在特定文化背景下难以共同维护图像相关性、上下文适当性和幽默质量。为了解决这个限制,我们引入了一种新的多模式生成任务,即文化感知的幽默图像描述,它需要一个模型根据输入图像和目标文化背景生成幽默图像描述。在不同文化背景下生成的图像描述不应具有相同的表面形式,而应保持相似的视觉情境或幽默原理。为了支持这项任务,我们建立了一个涵盖图像相关性、上下文契合度、语义丰富性、合理性、幽默性和创造力的六维评估框架。我们进一步提出了一个分阶段对齐框架,首先在西方文化背景下用高资源监督初始化模型,然后通过基于判断的GRPO和退化感知原型排斥约束进行多维偏好对齐,以减轻开放式生成中的奖励作弊,最后用少量监督使模型适应东方文化背景。实验结果表明,我们的方法在所提出的评估框架下取得了更强的整体表现,在上下文契合度方面取得了特别大的进步,并且在文化约束下在图像相关性和幽默之间取得了更好的平衡。