论文
通过强化学习进行推理引导的部分级视觉基础
Reasoning-Guided Part-Level Visual Grounding via Reinforcement Learning
摘要
多模态 大语言模型 (MLLM) 可以很好地根据自由格式语言查询来基础整个对象,但当查询命名部分而不是对象时,它们会遇到困难。我们将此追溯到缺失的对象部分层次结构,因为部分在用于对象的同一步骤中进行本地化。我们提出了对象部分分层反射定位(OP-HRG),这是一种从粗到细推理引导的定位策略,首先定位父对象,然后定位其中的部分。然后,自我检查会反映结果,并扩展对预测裁剪图进行重新编码以检查其正在纠正的区域。我们引入了一个部分感知的 GRPO 框架,通过阶段性奖励来训练我们的管道。以这种方式训练的 4B 模型在 PascalPart、PartImageNet 和 InstructPart 上的表现优于基于 LLM 和 SAM3 的 7B 模型,并且可以转移到推理分割。