论文
从像素到词元:视觉-语言-动作模型潜在动作监督的系统研究
From Pixels to Tokens: A Systematic Study of Latent Action Supervision for Vision-Language-Action Models
摘要
潜在动作作为中间表示,可以跨异构数据集对视觉-语言-动作 (VLA) 模型进行一致建模。然而,监督具有潜在行为的 VLA 的方法是零散的,并且缺乏系统的比较。这项工作从两个角度构建了潜在动作监督的研究:(i)通过基于图像的潜在动作规范轨迹,以及(ii)将目标空间与基于动作的潜在动作统一起来。在统一的 VLA 基线下,我们实例化并比较了四种有代表性的集成策略。我们的结果揭示了公式与任务的对应关系:基于图像的潜在动作有利于长视野推理和场景级概括,而基于动作的潜在动作则擅长复杂的运动协调。此外,我们发现使用离散潜在动作标记直接监督 VLM 可以产生最有效的性能。最后,我们的实验对混合数据中潜在动作监督的好处提供了初步见解,为 VLA 训练提出了一个有希望的方向。代码可在 https://github.com/RUCKBreasoning/From_Pixels_to_Tokens 获取。