论文
让它变得简单:视觉-语言-动作模型的一步动作生成
Let It Be Simple: One-Step Action Generation for Vision-Language-Action Models
摘要
从稀疏文本生成不同的图像很困难;从丰富的观察中生成紧凑的动作更容易。从条件-目标视图来看,视觉-语言-动作(VLA)与图像到文本对齐,而不是文本到图像。我们通过标准流匹配的不可约速度损失 $R_v(t,c)$ 形式化了这一观点,并通过受控 8 模式玩具实验和图像到文本 MNIST 任务对其进行了验证。然后我们表明,高噪声训练增强了标准 LIBERO 上的一步 VLA 解码,在 LIBERO-Long 上实现了 95.6%,并且在 LIBERO-Plus、LIBERO-Pro 和现实世界的机器人任务中保持竞争力,而削弱条件或扩大范围的消融可预见地消除了一步增益。这些结果表明,一步动作生成在 VLA 中是否有效并不取决于专门的训练,而是取决于条件-目标结构。