论文

WARP-VLA:视觉-语言-动作模型中视图稳健策略执行的腕式摄像头自适应

WARP-VLA: Wrist-Camera Adaptation for View-Robust Policy Execution in Vision-Language-Action Models

模型训练模型评测应用与实践参数高效训练鲁棒性、公平性与可信度评测机器人

摘要

尽管用于机器人操作的视觉-语言-动作模型(VLA)最近取得了进展,但它们的性能仍然对相机配置的变化敏感。这个问题在交叉设置部署中变得更加明显,因为复制用于训练的精确相机姿势几乎是不可能的。与固定的外部视图不同,手腕视图更具挑战性,因为相机随机器人一起移动,即使很小的安装变化也会改变细粒度的几何线索。为了解决这个问题,我们提出了 WARP-VLA,这是一种适用于多种腕式相机配置的相机视图鲁棒 VLA。 WARP-VLA 采用专家混合 (MoE) 架构,其中各个专家学习特定于视图的特征转换,路由器根据隐式视图信息将它们组合起来。这允许部署策略,而不需要相机外部参数作为额外的输入。通过在 LIBERO 基准上的实验,WARP-VLA 将手腕视图扰动下 pi-0.5 的平均成功率从 39.2% 提高到 78.3%。真实机器人实验进一步表明,特征级 在模拟中学到的适应成功地转移到不同的部署设置。为了促进可重复性和未来的研究,我们发布了手腕视点鲁棒性基准和即插即用的实现。