论文

M$^3$R-Bench:循证多模态隐喻理解的统一基准

M$^3$R-Bench: A Unified Benchmark for Evidence-Grounded Multimodal Metaphor Understanding

模型评测基准与评测资源

摘要

隐喻可以通过跨领域映射来理解抽象概念,同时传达情感态度。在多模态场景中,视觉和文本信息共同构建目标-源映射,需要概念理解和跨模态推理。然而,现有的基准主要通过孤立的子任务来评估隐喻理解,缺乏基于证据的解释,使得很难评估模型是否建立基于视觉和文本线索的映射。为了解决这些限制,我们引入了 M$^3$R-Bench,这是一个统一的、基于证据的基准,包含 1,000 个带有人工验证注释的图像-文本实例。在概念隐喻理论和非文字语言理解理论的指导下,M$^3$R-Bench按照“证据识别--映射建立--情感推理”对隐喻出现、目标-源映射、情感和阶段性解释进行联合注释。对M$^3$R-Bench的评估表明,现有模型往往忽视视觉证据,依赖肤浅的文本线索,产生不准确的目标-源映射,暴露了跨模式证据——映射不匹配。为了解决这种不匹配问题,我们提出了 M$^3$R-Reasoner,它将基于课程的推理监督与任务感知强化学习相结合,使模型推理与隐喻解释保持一致。实验表明,仅使用 8B 参数主干,M$^3$R-Reasoner 在四个统一任务指标上的表现优于较大的专有 MLLM,并且在视觉证据和情感合理性得分上分别比 GPT-5.5 提高了 28.45 分和 30.11 分,同时在平均评分方面超过了 Claude-Sonnet-4.6 8.00 分。数据集和代码可在 https://github.com/hongshi4/M3R-Bench 获取。