论文

PointRL:从可验证的注释证据中学习点级视觉语言基础

PointRL: Learning Point-Level Vision-Language Grounding from Verifiable Annotation Evidence

模型训练强化学习

摘要

视觉语言模型 (VLM) 越来越依赖点坐标作为 GUI 交互、机器人操作和交互式视觉系统中视觉基础的紧凑且可执行的界面。然而,学习可靠的指向行为仍然很困难,因为监督空间本质上是非唯一的:许多坐标在同一目标区域内可能是有效的,而多实例指令需要目标覆盖、计数一致性和重复抑制。这项工作提出了 PointRL,这是一个可验证的强化学习框架,可以从现有的异构注释证据中学习点级基础。 PointRL 将边界框、掩码和实例标签转换为指向指令,同时保留其目标支持、实例成员身份,并将约束设置为隐藏的验证者证据,即保留在提示之外并由确定性检查器用于对预测进行评分的注释。提议的奖励评估可解析性、点有效性、实例覆盖率、基数一致性以及冗余或缺失的预测。在PointArena上,PointRL将Qwen3.5-4B的整体准确率从56.11%提高到65.58%。对 RoboSpatial、BLINK 和 Ref-Adv 的进一步评估显示,在评估的外部基准上具有相同的骨干增益,这表明可验证的点级反馈可能有利于这些设置中的空间基础。