论文

从零到英雄:无需训练 定制概念在世界模型中产生

From Zero to Hero: Training-Free Custom Concept Spawning in World Models

上下文与知识上下文工程

摘要

自回归世界模型已成为交互式视频生成的强大范例,允许用户通过操作导航动态生成的环境。这些模型通常以文本提示和/或单个参考系为条件,从中生成整个世界。然而,当用户导航到该帧中可见的内容之外时,看不见的区域就会由基本模型的先验填充,而没有机制让用户指定应该出现什么以及在哪里出现。这是游戏、交互式故事讲述和模拟等应用的基本限制,在这些应用中,可控的场景构成至关重要。我们将这种缺失的能力称为概念生成;将用户指定的视觉概念引入世界模型中,类似于游戏引擎中的生成。我们引入了 SPAWN(Swapping Pinned Anchor with Windowed iNjection),这是一种用于概念生成的 无需训练 方法。 SPAWN 利用图像到视频主干的结构特性:上下文内存的第一个槽固定到参考帧,并充当每个生成块的基础锚点。通过将该锚点与潜伏在短注入窗口上的外部概念交换并让原始锚点返回,我们可以使概念通过模型自身的内存在执行轨迹过程中自然传播。 SPAWN 支持从细粒度实体(例如角色和道具)到大规模元素(例如建筑物和地标)的概念,并接受概念图像或文本描述作为输入。实验表明,SPAWN 将概念与一致的光照、比例和视角相结合,同时保留身份和时间连贯性,这表明在现有的自回归世界模型中无需任何训练即可实现可控概念生成。