论文
ALAM:视觉-语言-动作模型的代数一致的潜在动作模型
ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models
摘要
视觉-语言-动作(VLA)模型仍然受到动作标记机器人数据稀缺的限制,而无动作视频则提供了物理世界如何变化的丰富证据。潜在动作模型提供了一种从视频中提取此类先验的有前途的方法,但重建训练的潜在代码不一定适合策略生成:它们可以预测未来的观察结果,但缺乏与机器人动作相一致地重用或生成所需的结构。我们引入了 ALAM(代数潜在动作模型),这是一种代数一致的潜在动作模型,它将无动作视频中的时间关系转化为结构监督。给定帧三元组,ALAM 学习以重建为基础的潜在转换,同时通过组合和反转一致性进行正则化,从而鼓励局部可加的转换空间。对于下游 VLA 学习,我们冻结预训练编码器,并使用其潜在转换序列作为辅助生成目标,在联合流匹配目标下与机器人动作共同生成。这将结构化潜在转换与基于流的策略生成结合起来,允许策略利用 ALAM 的本地一致转换几何结构,而不需要潜在操作解码。表征探针表明,与非结构化潜在作用基线相比,ALAM 将可加性和可逆性误差降低了 25-85 倍,并改进了长范围累积重建。当转移到 VLA 策略时,ALAM 将 MetaWorld MT50 上的平均成功率从 47.9% 提高到 85.0%,将 LIBERO 上的平均成功率从 94.1% 提高到 98.1%,并且在现实世界的操纵任务中持续获得收益。消融进一步证实,最强大的改进来自代数结构的潜在转换和联合流匹配之间的协同作用。