论文
轻交互:交互式视频世界模型的无需训练推理加速
Light Interaction: Training-Free Inference Acceleration for Interactive Video World Models
摘要
交互式视频世界模型响应用户控制的摄像机移动,逐块生成视频,支持实时游戏模拟、虚拟场景导航和具体人工智能训练等应用。然而,由于不断增长的上下文记忆、二次注意力复杂性和重复的去噪步骤,扩展到长交互轨迹的成本过高。我们推出 Light Interaction,这是一个用于交互式视频世界模型的 无需训练 推理加速框架。我们的主要见解是,交互自然地实现了轨迹相关的自适应计算:在新颖的探索过程中可以丢弃检索到的空间记忆,可以根据局部潜在动态调整时间上下文,并且当相机重新访问熟悉的区域时可以重用早期模型输出。基于这一见解,Light Interaction 将自适应上下文管理、去噪缓存加速以及软硬件联合设计的 3D 块稀疏注意力与融合 Triton 内核相结合。在 HY-WorldPlay 和 Matrix-Game-3.0 上进行评估,Light Interaction 在无需模型重新训练的情况下实现了高达 2.59 倍的加速,同时保持了有竞争力的视觉质量。