论文
EmbodiedVAE:解开的视频 VAE,用于高效且可控的体现操作
EmbodiedVAE: Disentangled Video VAE for Efficient and Controllable Embodied Manipulation
摘要
潜在扩散模型(LDM)最近在构建强大的体现操纵世界模型方面显着推进了体现学习。然而,尽管性能出色,现有的LDM主要依赖于针对自然场景优化的变分自动编码器(VAE),而未能考虑具体操作场景的独特特征,产生既不紧凑也不可控的潜在表示,从而阻碍了LDM的有效训练和精确的机器人控制。为了解决这个问题,我们提出了 EmbodiedVAE,一种新颖的视频 VAE,它为机器人操纵世界模型提供紧凑但可控的潜在表示。具体来说,EmbodiedVAE采用双编码器、单解码器架构和非对称时空压缩模块,自动将机械臂的运动与背景环境分离,从而实现整体紧凑性,同时提供显式的体现潜伏以支持细粒度的动作控制。为了进一步保持学习的机器人潜在运动的时间一致性,我们引入了一种基于最佳传输的一致性模块,该模块明确地强制运动保真度和帧间一致性。大量实验表明,我们提出的 EmbodiedVAE 以高压缩率实现了卓越的重建质量,同时在机器人操作场景中实现了更精确的动作控制,与最先进的视频 VAE 相比,平均 PSNR 提高了 2dB。