论文
咒语:自然语言作为多实体视频世界模型的动作接口
Incantation: Natural Language as the Action Interface for Multi-Entity Video World Models
摘要
现代交互式视频世界模型已经实现了令人印象深刻的视觉保真度,但缺乏细粒度的多实体控制和跨实体、跨世界的泛化。我们将这一差距追溯到动作接口:标准控制协议(例如动画 ID、设备输入、场景级标题)在设计时将动作语义绑定到特定实体或引擎。我们提出用自然语言作为接口来释放先前接口无法实现的表现力,并且我们提出了 Incantation,这是第一个具有每潜在帧(0.25 s)自然语言调节的交互式视频世界模型,支持同步多实体控制和超越任何固定渲染管道的概念级跨实体传输。我们将预训练的双向视频主干与帧本地文本交叉注意力配对,并通过 ODE 初始化的自强制 蒸馏 和 RoPE 解耦滑动 KV 缓存实现实时长视野流。我们在跨实体传输(89% 对 43%)和词汇外提示(90% 对 0%)方面超越了 Action-Index 基线,并且我们的 2 步学生在 480p 下维持 19.7 FPS,并在 2 小时的采样轨迹中保持稳定的 FVD。我们进一步将相同的架构和训练方法应用于《拳皇》,仅更改每个实体的动作词汇槽。我们在 https://huggingface.co/datasets/zhush/incantation-elden-ring-scenes 上发布了咒语数据集的预览子集,其中包含手动收集的《Elden Ring》玩家-boss 战斗片段以及结构化的面向动作的元数据。更大规模的《Elden Ring》和《KOF》数据将随整个项目一起发布。