论文

VersaCamVLA:用于机器人操作的相机可配置 VLA 策略

VersaCamVLA: Camera-Configurable VLA Policies for Robotic Manipulation

应用与实践上下文与知识上下文工程机器人

摘要

视觉-语言-动作(VLA)模型已成为机器人操作的强大基础,但它们在训练过程中对固定相机配置的依赖使得它们在部署过程中容易受到相机数量或姿势变化的影响。为了克服这些限制,我们提出了 VersaCamVLA,这是一种相机可配置框架,可将相机设置表示与动作学习分离。 VersaCamVLA 学习一个统一的场景token接口,该接口将任意可变的姿势 RGB 视图集映射到固定大小的潜在场景token。这是通过多信号目标视图预测和手腕增强姿势采样 (WAPS) 来实现的,该采样利用自然的手腕相机运动来实现自由姿势多样性。在部署时,轻量级空间编码器将这些紧凑的场景标记注入到预训练的基础 VLA 中作为补充视觉条件,不需要显式的 3D 传感或新颖的视图渲染。 RoboTwin、LIBERO 和真实机器人平台上的实验表明,VersaCamVLA 始终优于先前的 VLA 方法和直接多视图基线,保持了稳健的性能 跨越不同的相机数量和看不见的相机姿势。