论文
AeroRAG:用于细粒度航空视觉推理的结构化多模态检索增强 LLM
AeroRAG: Structured Multimodal Retrieval-Augmented LLM for Fine-Grained Aerial Visual Reasoning
摘要
尽管多模态 大语言模型 (MLLM) 最近取得了进展,但空中场景中可靠的视觉问答仍然具有挑战性。在这样的场景中,任务关键证据通常由小对象、显式数量、粗略位置和对象间关系携带,而传统的密集视觉标记表示与这些结构化语义并不能很好地保持一致。为了解决这种界面不匹配的问题,我们提出了 AeroRAG,一种用于视觉问答的场景图引导的多模态检索增强生成框架。该框架首先将输入图像转换为结构化视觉知识,包括对象类别、数量、空间位置和语义关系,然后检索与查询相关的语义块,为基于文本的 大语言模型 构建紧凑的提示。我们的方法不是依赖于对密集视觉标记的直接推理,而是在感知和语言推理之间引入了更明确的中间接口。 AUG 航空数据集和通用域 VG-150 基准测试表明,在六个强大的 MLLM 基线上取得了一致的改进,在密集的航空场景和关系敏感推理中观察到最大的增益。我们进一步评估 VQAv2 上的框架,以验证所提出的界面是否与标准视觉推理设置兼容。这些结果表明,结构化检索是面向部署和扎根的视觉推理系统的实用设计方向。