论文

从想象的未来到可执行的动作:机器人操纵的潜在动作的混合

From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation

摘要

视频生成模型通过预测长期的未来观察结果,为机器人操作提供了一种有前途的想象机制,但有效利用这些想象的未来来执行动作仍然具有挑战性。现有的方法要么在预测帧上设置策略,要么直接将生成的视频解码为动作,这两种方法都受到视觉真实性和控制相关性之间不匹配的影响。因此,预测观察强调感知保真度,而不是状态转换的以行动为中心的原因,从而导致间接和不稳定的控制。为了解决这一差距,我们提出了 MoLA(潜在动作混合),这是一种面向控制的界面,可将想象的未来视频转换为可执行的表示。 MoLA 没有将预测帧直接传递给策略,而是利用预训练的逆动态模型的混合来推断生成的视觉转换所隐含的潜在动作的混合。这些模态感知逆动态模型捕获互补的语义、深度和流程线索,提供结构化且基于物理的动作表示,连接视频想象和政策执行。我们在模拟基准(LIBERO、CALVIN 和 LIBERO-Plus)和现实世界的机器人操作任务上评估我们的方法,在任务成功、时间一致性和泛化方面取得一致的收益。