论文
$μ_0$:可扩展的 3D 交互追踪世界模型
$μ_0$: A Scalable 3D Interaction-Trace World Model
摘要
捕捉动作如何引起物理变化的世界模型可以实现可扩展的机器人学习,而无需依赖于特定于实施例的动作标签。像素空间视频模型提供了广泛的视觉先验,但在密集外观重建上消耗了模型容量,而直接动作模型需要特定于实施例的标签,这会阻碍可扩展性。我们提出 $μ_0$,一个基于 3D 轨迹的可扩展世界模型。 $μ_0$ 不是预测密集像素或直接建模动作,而是预测对象、工具、手和接触区域等显着交互点的平滑 3D 轨迹,从而产生紧凑的、与实施例无关的运动界面。为了支持来自不同视频源的训练,我们的 TraceExtract 系统通过选择关键点、构建全局对齐轨迹以及将运动片段与分层语言描述相关联来自动提取 3D 监督。 TraceExtract 监督通过将预训练的视觉语言主干与模块化跟踪专家相结合来预训练 $μ_0$,该专家通过 B 样条控制点表示每个查询并预测未来的跟踪。实验表明,$μ_0$ 在 2D 和 3D 轨迹预测(包括轨迹预测模型和标记化 VLM 方法)方面均优于基线。由于 $μ_0$ 被冻结且可重复使用,因此它可以与下游机器人实施例的动作专家配对。尽管进行了无动作预训练,但所得到的跟踪条件策略的性能可与通过动作监督进行预训练的 VLA 模型(例如 $π_0$)相媲美。这些结果将 3D 轨迹建立为跨实施例操作的可扩展且可转移的表示形式。