论文
ONE-SHOT:通过空间解耦运动注入和混合上下文集成进行合成人类环境视频合成
ONE-SHOT: Compositional Human-Environment Video Synthesis via Spatial-Decoupled Motion Injection and Hybrid Context Integration
摘要
视频基础模型 (VFM) 的最新进展彻底改变了以人为中心的视频合成,但主题和场景的细粒度和独立编辑仍然是一个严峻的挑战。最近通过严格的 3D 几何组合来整合更丰富的环境控制的尝试经常会遇到精确控制和生成灵活性之间的严格权衡。此外,繁重的 3D 预处理仍然限制了实际的可扩展性。在本文中,我们提出了 ONE-SHOT,一种用于合成人类环境视频生成的参数高效框架。我们的主要见解是将生成过程分解为解开的信号。具体来说,我们引入了一种规范空间注入机制,通过交叉注意力将人类动态与环境线索分离。我们还提出了 Dynamic-Grounded-RoPE,这是一种新颖的位置嵌入策略,可以在不同的空间域之间建立空间对应关系,而无需任何启发式 3D 对齐。为了支持长视野合成,我们引入了混合上下文集成机制,以在分钟级生成之间保持主题和场景的一致性。实验表明,我们的方法明显优于最先进的方法,为视频合成提供了卓越的结构控制和创造性多样性。我们的项目已发布于:https://martayang.github.io/ONE-SHOT/。