论文
符号依据对齐揭示抽象视觉推理中的表征瓶颈
Symbolic Grounding Reveals Representational Bottlenecks in Abstract Visual Reasoning
摘要
视觉-语言模型(VLM)在诸如Bongard问题等抽象视觉推理基准上常常失败,这引出一个问题:主要瓶颈究竟在于推理还是表征。我们在Bongard-LOGO上研究这一问题——这是一个带有真值生成程序的抽象概念学习合成基准——方法是将直接处理原始图像的端到端VLM与获得由这些图像导出的符号输入的大语言模型(LLM)进行对比。符号输入在此用作诊断探针而非实用的多模态架构,我们的组件化-文法式(Componential-Grammatical,C-G)范式将Bongard-LOGO重新表述为基于LOGO风格动作程序或结构化描述的符号推理任务。LLM取得了大幅且一致的提升,在Free-form问题上达到中90%段(mid-90s)的准确率,而一个强大的视觉基线在匹配的任务定义下仍接近随机水平。对输入格式、显式概念提示和最小视觉接地的消融实验表明,这些因素的影响远小于从像素到符号结构的转变。这些结果将表征确定为抽象视觉推理的关键瓶颈,并展示了符号输入如何充当受控的诊断性上限。
