论文

迈向预测性、一致性和可扩展的机器人学习

Towards Predictive, Aligned, and Scalable Robot Learning

模型架构新型架构

摘要

学习的核心超越了记忆,延伸到通过探索可能性空间来推理和解决新问题的能力。我们引入了 Lumo-2,一种潜在的世界动作模型,它通过推理潜在空间中的世界动态来生成动作。学习到的潜在世界动态捕捉符合物理规律的视觉状态变化,自然地编码未来的可能性,并为跨模式对齐提供统一的基础。这种公式可以实现类似于世界建模的预测推理,同时保持轻量级并专注于与控制相关的物理动力学。我们方法的核心是假设动作生成质量由潜在空间的几何形状控制。我们观察到,基于标准重建的动作标记化目标会导致偏向于低水平信号保真度的表示,从而导致重建质量和下游控制性能之间的不一致。为了解决这个限制,我们提出了一种多阶段模态预对齐策略,其中动作表示逐渐与潜在的世界动态、视觉和语言对齐。这个过程增强了跨模式一致性,促进抽象,并为预测推理引入结构化的潜在空间。我们对潜在世界建模和模态对齐进行了系统的实证研究,分析了它们在尺度法则和分布外泛化中的作用。结果表明,Lumo-2 始终优于强大的视觉语言动作 (VLA) 和世界动作模型 (WAM) 基线,在需要时间推理、物理理解或高控制复杂性(包括长视野和灵巧操作)的挑战性现实世界任务方面取得了进展。这些发现表明,结构化多模态对齐和预测推理是推进具身智能的基本原则。