论文

GroundingPI:利用视觉基元实现物理智能的基础模型

GroundingPI: A Grounding Foundation Model towards Physical Intelligence with Visual Primitives

模型训练预训练

摘要

精确grounding很重要。它指定哪个对象是目标以及该对象所在的位置,即使在杂乱的情况下和对于微小的对象也是如此,并且它必须足够快才能进行闭环控制。然而,视觉语言动作(VLA)和世界动作模型(WAM)从通用视觉语言和视频生成主干中获取感知,但在这些设置中仍然失败。我们引入了 GroundingPI,这是一个 4B 基础模型,可生成点和框作为共享词汇表中的量化坐标。训练结合了多模态和空间预训练、监督微调以及 GRPO 的强化学习,使用公共数据集和专用数据引擎的监督。针对跨越 11 个感知能力的 34 个grounding基准的 44 个基线,GroundingPI 建立了一个新的最先进水平,平均为 73.68%,高于更大的 GPT-6 Astra (71.54%)。作为下游视觉支柱,GroundingPI 提高了机器人操作和自动驾驶的性能。在 RoboTwin 2.0 上,它的性能优于我们在所有四种分布外设置中评估的所有主流骨干网,相对于最强骨干网高达 24.8%。在 RoboCasa-GR1 上,GroundingPI 经过 50% 的演示训练,其表现优于那些经过 75% 训练的基线。在用作视觉主干的 nuScenes 上,GroundingPI 的平均开环 L2 误差为 0.296 m。我们系统地分析了GroundingPI的预训练规模和数据构成。随着预训练规模的扩大,下游自动驾驶和机器人操作得到改善。对这 11 种感知能力的数据配方进行分析表明,密集grounding对两者都有巨大的好处,并且 OCR 作为感知学习催化剂的潜力。这些结果支持grounding作为感知基础,并支持专门的感知预训练作为物理智能基础模型的一个有前途的方向。

GroundingPI:利用视觉基元实现物理智能的基础模型:图1:GroundingPI架构。grounding示例包含两个小黄人、一个人类,以及不存在的汽车类别(None)。架构规格和参数量详见第7.2节。
图1:GroundingPI架构。grounding示例包含两个小黄人、一个人类,以及不存在的汽车类别(None)。架构规格和参数量详见第7.2节。