论文
WLA$^3$:语义、动力学和运动学的世界潜在动作建模
WLA$^3$: World Latent Action Modeling for Semantics, Dynamics, and Kinematics
摘要
由于缺乏统一、低噪音的行动监督,使用异构数据扩展通用政策模型受到限制。人类以自我为中心的视频非常多,但只有一小部分带有高质量的手部动作标签。观察到的世界转变提供了跨数据源的与行动相关的监督的共同来源。我们引入了 WLA$^3$(语义、动力学和运动学的世界潜在动作建模),这是一个围绕世界潜在动作模型(WLAM)学习的表示构建的统一的通用策略模型框架。 WLAM 首先了解多模态世界状态如何在局部间隔内变化,将同步摄像机视图和可用的实施例状态变化编码为紧凑的局部潜在动作和更丰富的转换特征。从部分模态重建和重叠窗口之间的一致性鼓励稳健的转换表示。 WLA$^3$ 在语义、动力学和运动学方面重用它们:局部潜在动作支持动作敏感的物理动力学建模,分段级特征通过语义潜在聚合 (SLA) 直接监督 VLM,动作专家与特定实施例的机器人控制一起联合预测潜在动作。人类视频提供可扩展的转换监督,而机器人轨迹则将共享表示建立在可执行的本机控件中。在 LARYBench 上,最终的 32D 潜在动作达到 67.89% 的平均分类精度。 WLA$^3$ 在六项真实机器人任务中取得了 81.9% 的平均成功率,而 $π_{0.5}$ 的平均成功率为 66.2%。随着通用策略模型中期训练数据规模的扩大,性能得到提高,并且人类视频支持人机传输。项目页面可以在 https://wla-3.github.io/ 找到。