论文
CGC:用于细粒度多图像理解的构图对比
CGC: Compositional Grounded Contrast for Fine-Grained Multi-Image Understanding
摘要
尽管多模态 大语言模型 (MLLM) 发展迅速,但它们在细粒度多图像理解方面仍然面临着显着的挑战,经常表现出空间幻觉、注意力泄漏和物体恒常性失败。此外,现有方法通常依赖于昂贵的人工注释或大规模思想链(CoT)数据生成。我们提出了 Compositional Grounded Contrast(简称 CGC),这是一种低成本的完整框架,用于促进 MLLM 的细粒度多图像理解。基于现有的单图像基础注释,CGC 通过图像间对比度和图像内对比度构建组合多图像训练实例,分别引入用于跨图像区分的语义解耦干扰上下文和用于对象恒定性的相关跨视图样本。 CGC 进一步在 GRPO 框架内引入基于规则的空间奖励,以在“Think-before-Grounding”范式下改进源图像归因、空间对齐和结构化输出有效性。实验表明,CGC 在细粒度多图像基准测试(包括 MIG-Bench 和 VLM2-Bench)上取得了最先进的结果。学习到的多图像理解能力也转移到更广泛的多模态理解和推理任务,在 MathVista (+2.90)、MuirBench (+2.88)、MMStar (+1.93)、MMMU (+1.77) 和 BLINK (+1.69) 上比 Qwen3-VL-8B 基本模型产生一致的增益。