论文

ViPSim:协作视觉和参数空间以实现一致的长视野具体世界模型

ViPSim: Collaborating Visual and Parameter Spaces for Consistent Long-Horizon Embodied World Models

摘要

具身世界模型 (EWM) 已成为一种可扩展且无风险的范式,用于推进具身智能,从而实现视觉-语言-行动系统的安全关键评估。然而,它们作为评估基准和基础模拟器的可靠性常常受到低维动作和高维视频合成之间的表示差距的阻碍。这种差距导致缺乏几何对应,表现为在长程预测轨迹期间累积的轨迹漂移和不一致的机器人-物体交互。为了弥补这一差距,我们提出了 ViPSim,这是一个通过视觉和参数空间的协同协作实现一致的长视野生成的框架。我们将视觉空间定义为一个明确的空间先验域,集成了末端执行器姿势的像素对齐投影、相机视角、深度信息场景几何和机器人形态掩模,以提供密集的结构几何依据。同时,参数空间充当数值驱动器的域,注入原始动作序列和相机矩阵以提供精确的运动引导。通过统一这两个空间,ViPSim 确保生成的状态同时由几何边界锚定并由数字命令引导。大量实验表明,ViPSim 与主干网无关,并且显着增强了轨迹一致性。值得注意的是,我们的方法展示了与可变形物体(例如布料折叠)生成复杂交互的新兴能力,并在分布外和跨实体场景中保持稳健的性能,为实体代理的自动评估和预测控制提供了高保真基础。