论文

ReWorld:具有长程记忆的交互式世界模型

ReWorld: An Interactive World Model with Long-Horizon Memory

模型架构Transformer

摘要

交互式世界模型必须遵循用户的动作、记住它展示过的地方,并实时流式生成。这种张力是结构性的:控制需要短时程,记忆需要无界时程。ReWorld在训练时把两者分离,在推理时为两者设界。混合的逐头注意力窗口让大多数头只关注近期过去,而一小组全局头注意整个历史;随机头路由使任一能力都不会绑定到特定头;随机块丢弃使稀疏历史处于分布之内。推理时,全部过去被置于固定预算之下:一个由按位姿索引的地标库支撑的有界KV缓存,模型从中检索距当前位姿最近的地标。一个按米制尺度对齐的数据引擎把八个来源——Unreal渲染的穿越飞行、游戏漫游和真实世界影像——置于同一物理动作尺度,因此同样的按键在每个来源中移动相机的距离相同;回文轨迹提供记忆训练所需的重访证据。局限于LoRA适配器的分布匹配蒸馏随后将采样压缩至四步:同一骨干既服务高保真多步模式,也服务实时交互模式,在写实、游戏风格和风格化世界中流式生成704x1280视频。在覆盖动作遵循、长程回忆与视频质量的三轴协议下,对比六个近期交互式世界模型,它取得最佳控制保真度(11.95度旋转误差与最佳相机运动一致性)和最佳生成质量;在分钟级往返rollout(64秒、384个latent)上,其固定的12块缓存仍能重新生成起始视角——而在这种rollout长度下,滑动窗口早已驱逐了证据,全KV注意力则内存耗尽。

ReWorld:具有长程记忆的交互式世界模型:论文配图
图2:ReWorld 概览。左:度量对齐的数据流程将 UE 渲染影像、真实世界影像与游戏影像置于同一物理动作尺度上,而回文路线——相机沿自身路径折返——提供重访监督(第 3 节)。中:教师强制训练将双向主干转化为流式世界模型,同时训练 DMD LoRA 用于少步实时推理(第 2.2 与 2.4 节);控制(动作注入、局部短窗口头)与记忆(MRoPE 位姿索引注意力、全局长窗口头)解耦,全局头与局部头的划分每一步都通过固定的随机划分池进行切换,使两种能力都不绑定于特定头(第 2.2 节);块丢弃训练随机遮蔽历史的部分内容,与模型在推理时将读取的稀疏缓存相匹配(第 2.3 节)。右:推理时,固定的缓存预算在正在生成的块旁保存一个汇块(sink chunk)、按位姿检索的地标与一个近期窗口;从近期窗口老化的块被整合进有界地标库,重访时按位姿邻近性检索,因此空间记忆能以恒定成本在无界 rollout 中持续存在(第 2.3 节)。