论文

GDLAM:用于高度解缠体现预训练的组解缠潜在动作模型

GDLAM: Group-Disentangled Latent Action Model for Highly Disentangled Embodied Pretraining

模型训练预训练

摘要

潜在动作模型(LAM)通过自我监督的未来预测从无动作视频中学习与动作相关的表示,为具体智能预训练提供了可扩展的范例。然而,现有的 LAM 将视觉变化的异构源(包括相机运动、对象动力学和交互事件)压缩为单个潜在向量,导致语义结构有限的纠缠表示,从而限制了世界模型的可控性和 VLA 策略的泛化。我们引入了组解缠潜在动作模型(GDLAM),这是一种潜在动作模型,其代码通过构建分解为 N 个组,每个组都有独立的变分瓶颈和空间门控路由路径,并使用一组信息几何目标进行训练:相互排他性、组和门稀疏性以及静态动态正交性,这使得组之间相互因果不同,而不仅仅是去相关。从数量上讲,对任何单个组的干预只会改变该组,而其他组则保持不变,并且 GDLAM 比强大的非结构化 LAM 大幅提高了无标签解缠指标,包括模块化、MIG 和 DCI。值得注意的是,这种分解并不以牺牲动作信息为代价:在三个互信息估计器和一个线性探针中,分组代码比分布内和分布外的整体基线提供更多信息。作为证明解开的代码是可重用的预训练货币的支持证据,我们进一步将其转移到两个下游机制:(1)世界建模:与 SOTA 基线相比,使用 GDLAM 预训练的世界模型实现了卓越的部署保真度和动作跟踪能力。 (2) VLA 策略:使用 GDLAM 进行预训练,在多个模拟基准和现实世界的机器人操作任务中,与之前的方法相比,大大提高了任务成功率