论文

YUBI-STAG:自动补齐VLA示范中的接触与语义标注

YUBI-STAG: Contact and Semantic-Rich Alignment for VLAs via Automated Video-Language Grounding

模型训练模型优化应用与实践合成数据蒸馏机器人

摘要

视觉-语言-动作(VLA)模型通过大规模预训练获得广泛的操作能力,但通过语言引发这些能力需要指令和物理交互之间的细粒度对齐。现有的机器人演示通常只提供粗略的任务描述,忽略了动作的执行方式,包括哪个夹具动作、接触哪个物体以及如何抓取和移动物体。我们介绍了 YUBI-STAG,这是一个时空注释和基础框架,它可以通过交互丰富的语义自动丰富操作演示,从而将预训练的 VLA 与细粒度的操作语言对齐。 YUBI-STAG 将接触对象分割与视觉语言模型相结合,对对象身份、属性和状态、每个抓手的动作、双手协调和空间交互进行注释。为了解决 YUBI-STAG 对本地化序列和多阶段 VLM 推理的依赖,我们将其提炼为 YUBI-VLM。 YUBI-VLM 在很少的推理调用中直接从原始、未分段的视频中恢复动作结构和注释 仅从手腕视图进行操作。我们在 YUBI-STAG-Bench 上跨时间、语义和空间基础任务评估这两个框架。 YUBI-VLM 保留了 YUBI-STAG 的大部分注释准确性,推理调用更少,运行时间更短,同时推广到看不见的操作。最后,针对这些注释的训练后 VLA 策略使它们与细粒度语言和接触感知结构保持一致。双手实验证明了性能和指令遵循能力的提高,包括对物体身份、动作抓手、目标位置和原始标签中缺少的空间关系的控制。

YUBI-STAG:自动补齐VLA示范中的接触与语义标注:论文原图
图 2:YUBI-STAG 概述。接触对象分割模块提取接触轨迹(每帧对象掩模的接触间隔)作为四个注释阶段的时空锚点:场景配置、PA 阶段和夹具协调、对象变化和基础 PA 描述。