论文

顺序很重要:视觉语言推理的中文多面板模因基准

Order Matters: A Chinese Multi-Panel Meme Benchmark for Vision-Language Reasoning

模型评测基准与评测资源

摘要

许多多模式任务取决于视觉元素的排序和组合方式,而不仅仅是单独识别它们。互联网模因是这个问题的一个紧凑例子:它们的妙语通常取决于受限的阅读顺序和跨面板的视觉文本提示。虽然大型视觉语言模型(LVLM)在单图像理解方面表现出强大的性能,但仍不清楚它们是否可以对结构化模因布局进行序列感知推理,尤其是在中国社交媒体中。我们引入了 CMPM,这是一个中文多面板 Meme 基准测试,包含 1,214 个带注释的样本,涵盖五种结构类型、顺序依赖性、面板顺序约束和可选的评论上下文。我们制定了一个两层评估:任务 1 探测结构类型和顺序敏感的面板测序(具有上下文消融设置),任务 2 使用人类在 5 个 1-3 Likert 维度(视觉、面板、幽默、上下文和 忠实性)上的评分来评估中文模因解释的生成。我们在统一协议下对五个具有代表性的 LVLM 进行基准测试。结果表明,规范显示准确性本身并不是顺序理解的证据:主要的洗牌条件会导致准确性急剧下降,揭示了顺序敏感的多模态推理中持续存在的差距。 Task2 偏好将 Gemini 3.1 Pro 和 GPT-5.5 置于开放模型之上,而评论上下文仅产生较小且混合的 Core4 增益。代码和数据将在接受后发布。