论文

符号依据对齐揭示抽象视觉推理中的表征瓶颈

Symbolic Grounding Reveals Representational Bottlenecks in Abstract Visual Reasoning

模型评测模型行为与机制分析

摘要

视觉-语言模型(VLM)在诸如Bongard问题等抽象视觉推理基准上常常失败,这引出一个问题:主要瓶颈究竟在于推理还是表征。我们在Bongard-LOGO上研究这一问题——这是一个带有真值生成程序的抽象概念学习合成基准——方法是将直接处理原始图像的端到端VLM与获得由这些图像导出的符号输入的大语言模型(LLM)进行对比。符号输入在此用作诊断探针而非实用的多模态架构,我们的组件化-文法式(Componential-Grammatical,C-G)范式将Bongard-LOGO重新表述为基于LOGO风格动作程序或结构化描述的符号推理任务。LLM取得了大幅且一致的提升,在Free-form问题上达到中90%段(mid-90s)的准确率,而一个强大的视觉基线在匹配的任务定义下仍接近随机水平。对输入格式、显式概念提示和最小视觉接地的消融实验表明,这些因素的影响远小于从像素到符号结构的转变。这些结果将表征确定为抽象视觉推理的关键瓶颈,并展示了符号输入如何充当受控的诊断性上限。

符号接地揭示抽象视觉推理中的表征瓶颈:论文配图
图 2:Bongard-LOGO 上的视觉和符号管道比较。在视觉路线(上)中,视觉语言模型(VLM)直接接收图像,并且必须推断结构和规则,通常会产生近乎偶然的准确性。在符号路线(下)中,问题实例由LOGO式的动作程序表示;然后,语言模型使用这些符号表示执行规则归纳和分类,从而在同一任务上实现更高的性能。