论文

SCAR:自监督连续动作表示学习

SCAR: Self-Supervised Continuous Action Representation Learning

模型训练预训练

摘要

尽管行动在具身智能中发挥着核心作用,但从视觉转换中学习可转移的行动表示仍然是一个基本挑战,特别是当世界模型必须在有限数据下跨实施例进行概括时。我们认为动作不仅仅是辅助调节信号,而且是一种独特的表征因素,它将可控变化与特定实施例的驱动解耦。在这项工作中,我们提出了 SCAR,一种联合逆向-正向动力学框架,用于从视觉转换中学习跨实施例的统一动作表示。 SCAR 建立在预训练的生成主干基础上,使用逆动力学模型 (IDM) 从潜在观察对中推断潜在动作,并使用正向动力学模型 (FDM) 来预测以它们为条件的未来动态。为了使潜在空间可转移而不是通用的视觉瓶颈,我们在限制任意视觉编码之前将潜在动作后向标准高斯正则化,并引入对抗性不变性来抑制特定于实施例和环境的干扰因素。 Procgen 和 Robotwin 数据集上的实验表明,与特定实施例的原始动作相比,学习到的统一潜在动作表示可以作为世界建模更强的条件接口,从而产生改进的跨实施例低数据适应和跨任务传输。总而言之,这些结果表明,动作可以作为跨实施例的可控变化的共享表示来学习,为更具可转移性和通用性的世界模型提供接口。