论文
PointAction:3D 点作为机器人控制的通用动作表示
PointAction: 3D Points as Universal Action Representations for Robot Control
摘要
视频动作模型 (VAM) 利用预先训练的视频扩散模型捕获的广泛视觉动态,为通用机器人操作提供了一条有希望的道路。然而,仅 RGB 视频执行轨迹不能直接操作:它们使度量 3D 运动、接触几何体和细粒度空间约束未指定,从而使操作基础不明确。与此同时,跨不同任务和实施例扩展行动监督的成本仍然很高。我们提出了 PointAction,这是一个通过显式的基于点的 4D 建模将视频预测与机器人动作连接起来的框架。 PointAction 对基础视频生成模型进行微调,以联合预测未来的 RGB 帧和动态 3D 点图,从而生成与任务相关的场景几何图形的时间一致的 3D 运动。这些点动态充当结构化的、与实施例无关的动作接口,基于扩散的动作解码器将其映射到可执行的机器人动作。通过使用度量 3D 点动态作为视频预测和控制之间的接口,PointAction 减少了仅 RGB 动作基础的模糊性,并支持在动作监督有限的情况下跨任务和实施例进行传输。实验表明,PointAction 在机器人场景上实现了最先进的 4D 生成质量,在模拟中优于现有基线,并推广到预训练期间未见过的两个真实机器人手臂。