论文

DLAM:具有时间约束的分布式潜在动作

DLAM: Distributional Latent Actions with Temporal Constraints

模型训练预训练

摘要

视觉-语言-动作(VLA)模型仍然受到稀缺的带有动作标记的机器人数据的限制,而无动作视频提供了对物理变化的丰富观察。潜在动作模型可以提取此类先验,但重建训练的代码可以预测未来的观察结果,而无需与机器人动作进行联合生成所需的结构。现有的结构化方法添加了时间约束,但保留了确定性的转变点,因此局部推断的转变中的残余误差可能会在递归组合下传播和复合。我们引入 DLAM,一种分布式潜在动作模型,它将每个转换表示为对角高斯。以参考系为条件的重建基于观察到的视觉变化的平均值,而等间隙三元组上的归一化组合和反转限制了平均值和维度方面的方差。方差合成使用轻量级共享相关系数来解释共享中间帧的相邻转换之间的依赖性,而反转则否定均值并保留方差。对于下游策略学习,我们冻结编码器并训练流匹配策略以联合生成平均转换序列和机器人动作。在保留转换上,DLAM 比现有的潜在动作基线学习更多时间一致的潜在动态,并在保留视频上实现更强的直接和累积重建。在相同的受控$π_0$传输协议下,它还提高了MetaWorld MT50、LIBERO和现实世界操纵任务的策略性能。受控消融表明,归一化均值约束占重建增益的大部分,而学习方差和相关感知组合则为下游控制提供了补充改进。