论文
PointVG-R:在 MLLM 中内化几何推理,通过视觉思维链进行精确指向定位
PointVG-R: Internalizing Geometric Reasoning in MLLMs for Precise Pointing Localization via Visual Chain of Thought
摘要
基于指向的视觉定位要求模型通过破译视觉场景和指向手势之间的复杂空间关系来精确定位目标对象。传统方法通常将输入图像编码为静态特征表示,并主要在语言领域内执行推理,通常忽略图像中固有的丰富感知线索和显式空间几何。在本研究中,我们旨在通过提出 PointVG-R(一种推理引导的多模态 大语言模型 (MLLM))来减轻模型在解释手势空间关系时的认知脆弱性。 PointVG-R 引入了基于指向的定位的几何感知推理,使模型能够通过强化学习 (RL) 和冷启动数据的战略集成来利用图像进行思考。具体来说,我们设计了一种新颖的几何推理管道,可以模拟人类在解释指向手势时所采用的迭代认知过程。此外,我们构建了 EgoPoint-CoT,这是一个高质量的视觉思想链 (CoT) 数据集,具有详细的推理轨迹,可通过监督 微调 (SFT) 和 RL 来指导模型。为了解决训练过程中遇到的学习信号质量变化的问题,我们进一步提出了一种基于组方差的自适应重要性加权策略,该策略动态调整奖励信号以优化学习过程。实验结果表明,PointVG-R 实现了 SOTA 性能,在 mIoU 中优于基线 $\textbf{15.86}$ 点。广泛的消融研究进一步验证了我们提出的模块的功效。代码:https://github.com/lingli1724/PointVG-R。