论文
SEVO:通过主动照明和以数据为中心的收集实现鲁棒 VLA 操作的语义增强虚拟观察
SEVO: Semantic-Enhanced Virtual Observation for Robust VLA Manipulation via Active Illumination and Data-Centric Collection
摘要
通过社区工具链在低成本硬件上训练的视觉-语言-动作 (VLA) 和模仿学习策略在部署到训练环境之外时经常会失败。现有的评估,包括最初的 ACT 和 SmolVLA 基准,显示出在受控、固定背景下的高成功率,但社区从业者报告称,向新环境的转移几乎为零。我们提出了 SEVO(语义增强虚拟观察),这是一种以数据为中心的方法,可以在不修改策略架构的情况下提高跨环境操作的鲁棒性。 SEVO 通过三种机制转换原始 RGB 相机流:(1) 身体固定相机,其组合视野覆盖整个操作工作空间;(2) 主动红色光谱照明,物理上标准化对象外观;(3) 实时 YOLO 分割叠加,提供背景不变的语义提示。至关重要的是,我们表明多样化的数据收集协议(在远程操作期间系统地改变照明、背景和干扰物)是泛化的最重要的因素。我们的目标是透明水瓶,即在视觉上与周围环境融为一体的物体,并选择一个简单的拾取和放置任务,以在两个移动平台上进行数百次受控的真实机器人试验。在训练环境中,整个管道在 ACT 中实现了 95% 的掌握成功率,在 SmolVLA 中实现了 83% 的掌握成功率,转移到新环境的成功率分别为 85% 和 75%。如果没有 SEVO,相同的策略在训练中只能达到 75%/70%,而在新环境中则下降到 30-35%。我们的结果表明,数据收集期间的原则性观察设计和环境多样性(而不是模型缩放)使低成本机器人能够在日常家庭环境中可靠运行。