论文
Alaya-EVOKE:从线性缩放监督到无尽的世界
Alaya-EVOKE: From Linear-Scaling Supervision to Endless World
摘要
交互式世界模型必须支持持久记忆、响应式交互和长视野生成,但这些要求对模型提出了相互冲突的要求。在降噪器上下文或键值缓存中维护历史记录会导致成本不断增加,迫使在会话长度和保留内存之间进行权衡,而低延迟交互依赖于少步生成,其能力受到教师的限制。 Alaya-EVOKE(Evoke)通过外部化持续的世界状态并重新设计长期交互生成的教师来解决这两个局限性。场景几何图形保存在外部的、摄像机索引的世界状态库中,从中仅检索与视图相关的信息,从而随着会话的增长保持降噪器上下文的界限。我们没有将教师视为固定的生成器,而是将其设计为长视野监督:它的稀疏注意力结合了分块分组、所选远距离帧的检索和线性注意力全局状态,在内存和计算中产生线性增长,同时实现长视野监督。这种监督暴露了在短窗口内保持局部合理的内容漂移,而按块调节可以在整个序列中实现快速更改和事件控制。在自强制生成轨迹下应用的 30 秒分布匹配目标,将这两种能力转移给不使用无分类器指导的三步学生,提高对长期漂移的抵抗力,同时保持响应调节。凭借有界上下文和循环外部存储器,Evoke 支持开放式、不断发展的生成;在 $384\times 640$ 的单个 H200 上,每个 $1.5\,\mathrm{s}$ 块在 $2.11\,\mathrm{s}$ 中生成。作为三步世界模型,Evoke 在 WBench 上实现了最先进的性能,同时在 VBench-Long 和 VBench-2.0 上保持竞争力。