论文
CometVLA:针对物理理解的具体数据金字塔的联合训练
CometVLA: Co-Training on an Embodied Data Pyramid towards Physical Understanding
摘要
视觉-语言-动作(VLA)模型在需要物理常识的操作任务中仍然很脆弱。当前的物理 VQA 数据通常是脱离实体的,并且与机器人动作域不一致。以自我为中心的视频仅用作辅助 预训练。目前尚不清楚改进的 VLM 物理理解是否实际上有利于下游动作的生成。因此,我们提出 CometVLA 来弥补这一差距。我们构建了 CometData 和 CometBench,这是一个与机器人的动作数据和体现严格一致的具体物理 VQA 语料库和基准。我们引入了全局动作先验(GAP)词元,这是一个紧凑的可学习瓶颈,它隔离了与任务无关的运动规律,并让动作头消耗物理常识,而不会破坏预先训练的 VLM 主干。我们跨具体数据金字塔共同训练 CometVLA,涵盖远程操作、模拟、自我中心轨迹和 VQA 层。在现实世界的操作任务和 RoboTwin 模拟中,CometVLA 始终优于强大的 VLA 基线。相关分析表明,CometBench 上的 VLM 性能越强,表明 VLA 成功率越高。结果表明,物理理解 预训练 确实有利于下游操作。