论文
FlexComposer:通过灵活的轨迹控制从图像到动态素材的统一视频合成
FlexComposer: Unified Video Compositing from Images to Dynamic Footage with Flexible Trajectory Control
摘要
生成视频合成涉及将外部资源无缝插入到现有视频序列中,这对于内容创建和视觉效果至关重要。然而,现有的方法面临着控制保真度的权衡:它们要么从静态图像中产生运动幻觉,无法保留预动画资产的动态,要么缺乏沿着用户定义的轨迹精确资产放置的细粒度空间控制。我们提出了 FlexComposer,这是一个统一的框架,它将视频合成标准化为轨迹引导的条件生成任务,从而实现静态图像和动态镜头的无缝集成。我们的方法引入了三个关键设计:(1)统一规范前景表示,将对象的固有运动与其全局位移解耦,将异构输入标准化为稳定的、居中的潜在空间; (2) 空间感知潜在注入策略,利用 VAE 潜在空间的平移等变性,通过无参数机制将规范特征传输到目标轨迹上; (3) 混合数据集和合成真实课程,协同程序模拟、真实世界的电影镜头和生成数据,以隐式学习物理上合理的照明和阴影协调。这种统一的设计可以处理从产品照片到动态主体的各种输入,从而实现高保真运动控制和环境集成,而无需显式 3D 重建或辅助可学习适配器。大量实验表明,FlexComposer 在视觉质量、时间一致性和轨迹依从性方面优于最先进的方法。