论文

ZYT-World:闭环自动驾驶仿真的实时可控世界模型

ZYT-World: A Real-Time Controllable World Model for Closed-Loop Autonomous-Driving Simulation

摘要

生成世界模型为端到端和视觉语言动作驱动策略提供可控且可重复的闭环模拟,但生产部署暴露了三个未解决的要求:以原始分辨率忠实地再现混合鱼眼针孔装置;协调因果、每个时间步的交互与长范围稳定性和低延迟;当重新访问某个位置时保留场景身份。我们提出了 ZYT-World,这是一种单一架构,可以原生生成四个视场 > 180° 的鱼眼视图和三个针孔视图。投影专用的 Plucker 适配器对相机几何结构进行编码,自车运动自适应层标准化提供全局运动控制,轻量级像素对齐布局通过实例级框、朝向和颜色调节交通参与者和信号。异构训练将完整相机组的几何覆盖与高分辨率细节相结合。教师强制、因果一致性蒸馏、基于自身生成轨迹的分布匹配蒸馏和 RigCritic 将 40 步双向教师转变为单步、每潜在流生成器,RigCritic 联合评估七视图相机组。 19M 参数变分自动编码器解码器 (TinyVAE)、W8A8 量化和我们的推理引擎分别降低了解码、主干和增量执行成本。最后,从真实捕获中得出的交叉轨迹对训练了一个插件隐式记忆模块,该模块可以保留特定地点的证据。在内部多视图测试集上,一步模型保留了教师90%以上的PSNR和SSIM,而FID、FVD和LPIPS则保持在教师的11%以内。在图 2 中的仅生成器时序下,它比 40 步双向教师快 107.7 倍。 TinyVAE 的解码速度比 Wan 快 59.8 倍。 30秒生成轨迹和跨轨迹回顾显示了预期的长期视野和记忆行为。