论文

监督幸存的东西:来自合成机器人视频的几何引导 VLA 适应

Supervise What Survives: Geometry-Guided VLA Adaptation from Synthetic Robot Videos

模型训练监督微调与指令调优

摘要

视觉-语言-动作(VLA)模型需要大规模的视频-动作对,但真正的远程操作仍然很少。虽然生成的机器人视频提供了可扩展的替代方案,但现有方法通过从合成像素恢复伪动作将它们视为真实的机器人数据。我们认为从生成的视觉效果中获得底层控制是一种不匹配的抽象。视频仅捕获 \emph{geometry}:表示任务的 \emph{where} 的空间轨迹。真实的演示捕获了 \emph{control}:代表 \emph{how} 的精确电机命令。人机视频生成保留了这些不平等:可见几何形状在生成过程中幸存下来,而底层控制信号却丢失了。这个\textbf{不对称保存原则}规定了一个明确的规则:这种幸存的几何体应该只监督视觉感知,将控制权留给真实的演示。遵循这一原则,我们提出 \textbf{GRA} (\textbf{G}eometry-guided \textbf{R}representation \textbf{A}lignment),它将几何内容提取为未来的 2D 末端效应器路径点,通过姿势估计、重定向、模拟和校准投影从源人类视频中计算出来,并通过辅助 2D 头将它们路由到 VLA 视觉主干。行动负责人仅接受过真实演示的培训。在 微调 期间,路径点丢失作为 \textbf{空间表示锚} 持续存在,以防止骨干网失去其几何依据。在真实的机器人任务中,GRA 在匹配的数据预算下优于伪动作基线,并缩小了与经过更多真实演示训练的策略的差距,这表明正确路由的几何结构比恢复的动作更可靠地连接生成的视频和机器人策略。