论文

CARV:面向多模态LLM组合式类比推理的诊断基准

CARV: A Diagnostic Benchmark for Compositional Analogical Reasoning in Multimodal LLMs

模型评测基准与评测资源

摘要

类比推理检验人类认知的一个基本方面:把关系从一对对象映射到另一对对象。针对多模态大语言模型(MLLM)这一能力的现有评估忽视了从多个来源组合规则的能力,而这是高阶智能的关键组成部分。为弥合这一缺口,我们提出CARV(Compositional Analogical Reasoning in Vision)这一新任务及配套的5,500样本数据集,作为首个诊断基准。我们将类比从单一对象对扩展到多个对象对,这要求MLLM从每个对象对中提取符号规则并组合出新的变换。在最先进MLLM上的评估揭示了惊人的性能差距:即便是Gemini-2.5 Pro也仅取得40.4%的准确率,远低于100%的人类水平。诊断分析显示出两种一致的失败模式:(1)将视觉变化分解为符号规则;(2)在多样或复杂设置下保持鲁棒性——凸显了当前MLLM在这一任务上的局限。

CARV:面向多模态LLM组合式类比推理的诊断基准:论文配图
图 1:单步和组合类比的示例。单步类比(左)提供从输入到目标的一种转换(颜色),而组合类比(右)提供颜色(木头到红色)和数字(一到二)转换的结合。