论文
以语言增强提升多模态大模型对遮挡与小目标的稳健定位
Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues
摘要
虽然多模态 大语言模型 (MLLM) 在一般场景中增强了视觉目标定位能力,但其在拥挤场景中的鲁棒性仍有待探索。拥挤的场景会带来视觉挑战(即遮挡和小物体),这会损害物体语义并降低视觉目标定位性能。相比之下,语言表达不受这种退化的影响并保留了对象语义。根据这些观察结果,我们提出了一种利用语言引导语义线索(LGSC)克服这些限制的新方法。具体来说,我们的方法引入了语义线索提取器 (SCE),以从 MLLM 的视觉管道中获取对象的语义线索。然后,我们使用相应的文本嵌入来引导这些线索,以生成 LGSC 作为语言语义先验。随后,它们被重新集成到原始视觉管道中以细化对象语义。大量实验和分析表明,将 LGSC 纳入 MLLM 可以有效提高拥挤场景中的视觉目标定位精度。