论文
Pose6DAug:用于机器人数据增强的物理上合理的多视图对象交换
Pose6DAug: Physically Plausible Multi-view Object Swapping for Robot Data Augmentation
摘要
视觉-语言-动作(VLA)策略在通用操作方面表现出了强大的潜力,但它们经常在外观或几何形状偏离训练分布的新颖的、分布外的对象上失败。标准的补救措施是收集每个故障案例的多视图远程操作数据,但这在成本和时间方面都表现不佳。我们引入了 Pose6DAug,这是一个失败驱动的数据增强框架,可以将政策自身的成功事件转化为其失败模式的有针对性的演示,而无需收集任何新的数据。我们的主要见解是,每个成功的事件都已经编码了物理上有效的动作轨迹以及校准的多视图观察。通过仅交换被操纵的对象,同时保留该轨迹,我们获得了新的且基于物理的演示。然而,简单的 2D 视频编辑破坏了多视图一致性和物理合理性,特别是在严重遮挡和以自我为中心的视点下。相反,我们的方法直接在 3D 中运行,通过由时间连贯的 6D 位姿轨迹驱动的显式网格来锚定目标对象,确保所有相机视图中的几何渲染一致。 微调 通过我们的方法增强的数据 VLA 相对于新颖对象的最先进基线,成功率提高了 16.5%,同时保持分布内性能。这些结果表明,多视图和物理一致的增强是可扩展 VLA 泛化的实用途径。