论文
学习具身AI的附加组合潜在动作
Learning Additively Compositional Latent Actions for Embodied AI
摘要
潜在动作学习从视觉转换中推断出伪动作标签,提供了一种利用互联网规模视频来实现人工智能的方法。然而,大多数方法在没有编码物理运动的加性、组合结构的结构先验的情况下学习潜在动作。因此,潜伏常常将不相关的场景细节或有关未来观察的信息与真实的状态变化和错误校准的运动幅度纠缠在一起。我们引入了附加组合潜在动作模型(AC-LAM),它在潜在动作空间的短视野内强制执行场景级附加组合结构。这些 AC 约束鼓励潜在动作空间中的简单代数结构(恒等、逆、循环一致性)并抑制不相加组成的信息。根据经验,AC-LAM 可以学习更加结构化、运动特定和位移校准的潜在动作,并为下游策略学习提供更强的监督,在模拟和现实桌面任务中优于最先进的 LAM。