论文

语义丰富的潜在视觉推理

Semantic-Enriched Latent Visual Reasoning

模型推理推理策略与问题分解

摘要

多模态潜在空间推理旨在通过直接在紧凑的潜在空间中执行视觉推理来用图像代替显式思维。然而,现有的方法很大程度上依赖于视觉监督,并产生缺乏足够语义丰富性的潜在表示,限制了它们支持不同区域级推理任务的能力。在这项工作中,我们介绍了语义丰富的潜在视觉推理(SLVR),这是一个两阶段学习框架,它通过属性级视觉语义丰富潜在表示,并使它们与不同的推理目标保持一致。在第一阶段,SLVR 在细粒度属性监督下学习语义丰富的以区域为中心的潜在变量。在第二阶段,我们设计多查询组相对策略优化(M-GRPO)来对齐同一区域中多个查询的潜在表示。为了支持这个框架,我们构建了 SLV-Set,其中包含大约 40 万个区域级属性注释和 80 万个多查询问答样本,并引入了 SV-QA,这是一种评估语义变化下潜在推理的基准。实验表明,与现有基线相比,SLVR 提高了潜在视觉推理的鲁棒性和语义一致性。