论文
LOCUS:用于增强多模式细粒度感知的本地视觉提示搜索 大语言模型
LOCUS: Local Visual Cue Search for Enhancing Fine-Grained Perception in Multimodal Large Language Models
摘要
即使高分辨率输入保留了必要的局部细节,多模态 大语言模型 (MLLM) 在细粒度视觉感知方面仍然不可靠。我们将这种限制称为视觉上下文腐烂:决定性的证据可能存在于完整图像中,但无法在冗余的视觉上下文中可靠地选择和使用。我们提出了 LOCUS(本地视觉 CUe 搜索),这是一个训练框架,教 MLLM 通过可验证的代理任务将本地证据搜索内化。在训练期间,LOCUS 提供局部裁剪作为视觉提示,并使用基于 IoU 的奖励来优化模型以恢复其在完整图像中的空间支持。视觉提示仅在训练期间使用,使标准图像问题推理界面保持不变。细粒度感知、幻觉、一般理解和推理基准的实验表明,LOCUS 提高了本地化敏感的视觉理解,同时保留了广泛的能力。注意力分析进一步表明,模型注意力更集中于与任务相关的证据区域,这表明训练时视觉线索搜索提供了内化细粒度证据选择的有效途径。