论文

组合视觉语言理解的推理时间结构推理

Inference-Time Structural Reasoning for Compositional Vision-Language Understanding

模型推理推理策略与问题分解

摘要

视觉语言模型(VLM)擅长图像文本检索,但在组合推理、区分共享相同单词但关系结构不同的图像描述方面一直失败。我们提出了一个统一的评估和增强框架,在普通和场景图增强制度下的 Winoground 基准上对四个架构不同的 VLM、CLIP、BLIP、LLaVA 和 Qwen3-VL-8B-Thinking 进行基准测试。我们引入了一个基于依赖性的 TextSceneGraphParser (spaCy),用于提取主语-关系-客体三元组,以及使用最佳二分匹配来注入结构关系先验的图不对称评分器。字幕消融实验(主客体掩蔽和交换)表明,Qwen3-VL-8B-Thinking 的组得分为 62.75,远远高于所有基于编码器的模型,而提出的多轮 SG 过滤策略将其进一步提升至 66.0,超过了之前的开源最先进技术。我们分析了能力增强的权衡,发现 SG 增强有利于已有能力的模型,同时为较弱的基线提供可忽略不计或负的增益。代码:https://github.com/amartyacodes/Inference-Time-Structural-Reasoning-for-Compositional-Vision-Language-Understanding