论文
ContextMaster:通过固定预算稀疏上下文路由创建交互式多镜头视频
ContextMaster: Interactive Multi-Shot Video Creation via Fixed-Budget Sparse Context Routing
摘要
最近的视频模型越来越多地支持在单个模型中生成、参考调节和编辑,但通常将它们公开为固定输入上的单独操作。实际创作涉及多个镜头,需要一个模型从文本生成、遵循参考或编辑源素材,同时维护共享历史记录。我们将此设置形式化为交互式多镜头视频创建(IMVC),并引入 ContextMaster,这是一个统一模型,具有用于这些操作的角色感知上下文表示。交互式模型必须保留对扩展历史记录的访问,而不允许每个去噪步骤的上下文读取成本增长。 ContextMaster 将可重用的干净上下文状态与固定预算稀疏上下文路由相结合,并使用 ConstraintSink 来保持任务约束可见。为了通过很少的去噪步骤解决稀疏上下文访问和推理的双重挑战,我们提出了一个两阶段特权上下文 蒸馏 框架,该框架通过一致性 蒸馏 从密集教师传输完整的上下文行为,然后通过分布匹配改进部署执行轨迹。对三个原始任务的实验表明,在专门的基线上,任务完成度和镜头之间的一致性得到了改善。用户研究进一步验证了灵活组合的工作流程,同时模型在单个 GPU 上达到了 16 FPS。