论文
InfiNoVA:观点不变机器人策略的无限新颖视图增强
InfiNoVA: Infinite Novel View Augmentation for Viewpoint Invariant Robot Policies
摘要
视觉-语言-动作 (VLA) 策略通常强烈依赖于训练期间看到的摄像机视角,从看不见的视角部署时会导致性能大幅下降。从足够多样化的物理视点收集演示是昂贵的,并且仍然只能提供视点空间的稀疏覆盖。我们引入了 InfiNoVA,这是一种数据增强框架,可将同步的多摄像头演示转换为几何一致的训练视图的密集分布。 InfiNoVA 将每个操作轨迹重建为时变 3D 高斯表示,并根据采样的相机姿势呈现新的观察结果,同时保留原始的状态-动作对应关系。这种明确的场景表示提高了帧级保真度和时间一致性,同时减少了生成小说视图合成中观察到的任务关键幻觉。在四个现实世界的操作任务中,使用 InfiNoVA 训练的策略在未见过的随机观点下取得的平均成功率比基于 VISTA 的增强和未增强的策略高出 5.4 倍。与直接在所有五个物理摄像机视图上进行训练相比,InfiNoVA 的成功率进一步提高了 1.7 倍。这些结果表明,密集的、基于几何的视点增强为相机稳健的机器人策略提供了一条实用的途径,而无需修改底层策略架构。