论文
WALL-WM:在活动关节处雕刻世界动作模型
WALL-WM: Carving World Action Modeling at the Event Joints
摘要
WALL-WM 是一种世界动作模型,它将视频动作学习从以块为中心的优化转变为基于事件的视觉-语言-动作预训练,使用语义连贯的动作事件作为学习的原子单元。现有的 WAM 通常从多模式或视频基础模型进行初始化,然后直接根据当前观察和指令优化固定长度的动作块。虽然方便,但这种以块为中心的公式造成了基本的粒度不匹配。语言描述语义目标和事件,视觉通过连续的场景动态演变,动作在控制级时间尺度上运行;强制所有三个进入相同的固定长度预测窗口将 VLA 训练转变为短视野相关拟合。 WALL-WM 通过围绕语义事件组织监督和数据来解决这种不匹配问题。具体来说,它将基于事件的 VLA 预训练与基于事件级描述和集群平衡采样构建的数据生态系统结合起来,从而实现对不同行为、场景和任务结构的可扩展学习。来自相同的事件预训练主干,WALL-WM 支持两种互补的推理模式。事件模式使用下一个事件描述并启用可变长度执行块,而统一模式使用带有阶梯解码的 VLM 来调节传统的固定长度块推理,同时保留梯度连续 VLA 路径。与基于 Muon 优化器的大规模预训练基础设施一起,WALL-WM 为通用 WAM 提供了实用的扩展方案。实验表明,WALL-WM 具有跨语言、场景和任务的广泛泛化能力,在大规模现实世界泛化评估中实现了最先进的性能。