论文

Zing-0.5:通过实时联合动作和文本控制迈向可玩的世界

Zing-0.5: Toward Playable Worlds with Real-Time Joint Action and Text Control

模型训练预训练

摘要

我们推出了 Zing-0.5,这是一种专为可玩性而设计的 5B 自回归世界模型:用户可以探索生成的世界,影响展开的事件,并通过联合键盘和在线文本控制对由此产生的反馈做出响应。我们的方法汇集了三个技术贡献:(1)统一动作和文本调节,将幅度感知键盘输入与时间对齐的文本指令和联合注释视频相结合,以学习同一序列内的导航和事件控制; (2)增量生成的事件规模监督,使用经过连接多提示视频训练的段级教师通过分布匹配蒸馏来监督块级因果学生; (3) 低成本实时交互,将四步生成与上下文保留流相结合,支持 24 FPS 的 832 x 480 推理,估计服务器租赁成本约为每流分钟 0.009 美元。 Zing-0.5 在 158 个 WBench Navigation 案例中的总体得分为 81.0,一致性得分为 88.5。联合控制演示显示了连续导航期间文本引导的事件变化,而无需重新启动生成。我们发布了模型权重、推理代码和 Zing-SGLang 服务实现,以支持可玩生成世界的进一步工作。