论文
CARV:面向多模态LLM组合式类比推理的诊断基准
CARV: A Diagnostic Benchmark for Compositional Analogical Reasoning in Multimodal LLMs
摘要
类比推理检验人类认知的一个基本方面:把关系从一对对象映射到另一对对象。针对多模态大语言模型(MLLM)这一能力的现有评估忽视了从多个来源组合规则的能力,而这是高阶智能的关键组成部分。为弥合这一缺口,我们提出CARV(Compositional Analogical Reasoning in Vision)这一新任务及配套的5,500样本数据集,作为首个诊断基准。我们将类比从单一对象对扩展到多个对象对,这要求MLLM从每个对象对中提取符号规则并组合出新的变换。在最先进MLLM上的评估揭示了惊人的性能差距:即便是Gemini-2.5 Pro也仅取得40.4%的准确率,远低于100%的人类水平。诊断分析显示出两种一致的失败模式:(1)将视觉变化分解为符号规则;(2)在多样或复杂设置下保持鲁棒性——凸显了当前MLLM在这一任务上的局限。
