论文
ReVA:用于视觉基础问答的区域感知视觉助手
ReVA: A Region-Aware Visual Assistant for Visually Grounded Question Answering
摘要
多模态 大语言模型 (MLLM) 在视觉问答 (VQA) 方面取得了显着进展,但它们仍然在解决需要精确空间推理和细粒度视觉理解的问题上遇到困难。这些限制通常表现为对象、属性和空间幻觉,其中由于区域级别和细粒度视觉基础不足,模型会生成自信但视觉上不受支持的响应。为了应对这一挑战,我们提出了 ReVA,这是一种区域感知 VQA 模型,该模型采用冻结的 CLIP ViT-L/14 Vision Transformer (ViT) 和 Qwen2.5-7B-Instruct 大语言模型 (LLM),通过双桥连接,将整个图像和区域级表示与 LLM 对齐嵌入空间。图像桥将最终的 Transformer 块特征映射到图像词元中。区域桥将 ViT 块上丰富的中间特征的裁剪特征映射到每个边界框的 K 区域词元中,因此早期纹理和后来的对象线索更加明显。 ReVA 使用检测器堆栈,使用 RAM++(识别任何模型)、spaCy 和 Grounding DINO,提供与问题无关和问题相关的自动零样本边界框。图像标记和区域标记作为 LLM 提示前缀连接起来,以便在回答问题时联合编码场景级上下文和细粒度区域证据。在 VQAv2、MMBench、POPE 和 SEED-Bench 上进行评估,ReVA 在 POPE 上实现了 82.85% 的平均 F1,而没有区域标记的图像标记基线的平均 F1 为 81.14%。这些结果表明,明确的区域感知视觉表示减少了物体幻觉并改善了 MLLM 的事实基础。