论文

SimInsert:通过区域稀疏注意力融合实现无缝视频对象插入

SimInsert: Seamless Video Object Insertion via Regional Sparse Attention Fusion

模型推理解码与生成控制

摘要

视频对象插入需要确保时空连贯性和交互真实性,远远超出了简单的内容放置。然而,当前的方法常常受到对显式运动工程或资源密集型再训练的依赖的阻碍,限制了它们的灵活性和泛化性。为了弥补这一差距,我们提出了 \textit{SimInsert},这是一种 无需训练 范例,可以有效地将任务分解为直观的单帧编辑和语义运动描述。通过利用图像到视频扩散模型的强大生成先验,SimInsert 可以暂时传播编辑,严格保留背景不变性,同时在插入的对象和动态环境之间实现合理的文本驱动交互。我们的方法取决于非侵入性引导机制,该机制强制结构一致性,促进无缝边界融合,并抵消通常在去噪轨迹期间累积的保真度漂移。大量的定量实验验证了我们的功效:SimInsert 超越了最先进的方法,PSNR 提高了 18.8%,SSIM 提高了 20.1%,LPIPS 降低了 44.1%,为高保真视频编辑提供了简化的解决方案。