论文

MolmoPoint:通过视觉定位词元改善图像与界面指向

MolmoPoint: Better Pointing for VLMs with Grounding Tokens

模型架构Transformer

摘要

目标定位已成为视觉语言模型 (VLM) 的一项基本功能。大多数现有的 VLM 通过生成坐标作为其文本输出的一部分来进行指向,这需要学习复杂的坐标系并导致较高的标记计数。相反,我们提出了一种更直观的指向机制,直接选择包含目标概念的视觉标记。我们的模型生成一个特殊的指向标记,该标记交叉参与输入图像或视频标记并选择合适的标记。为了使这个模型更加细粒度,我们在这些指向标记后面加上一个额外的特殊标记,该标记在最初选择的区域内选择一个细粒度的子补丁,然后是第三个标记,指定该子补丁内的位置。我们进一步表明,通过以一致的顺序顺序生成点、对先前选择的点的相对位置进行编码以及在选择视觉标记时包括特殊的无更多点类,可以提高性能。使用这种方法,我们在图像指向上设定了新的最先进水平(在 PointBench 上为 70.7%),在 GUI 指向上的完全开放模型中设定了新的最先进水平(在 ScreenSpotPro 上为 61.1%),并改进了视频指向(与文本坐标基线相比,人类偏好获胜率为 59.1%)和跟踪(在 Molmo2Track 上增加了 6.3%)。我们还表明,我们的方法实现了更高的样本效率,并讨论了这种设计变化带来的质量差异。