论文

IDAG-Edit:通过实例解耦注意力和指导进行多对象视频编辑

IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance

应用与实践内容创作

摘要

基于扩散的视频编辑取得了重大进展;然而,由于注意力泄漏、身份漂移和不稳定的时间动态,实现精确且时间一致的对象级控制,尤其是在多对象场景中,仍然具有挑战性。在这项工作中,我们提出了 IDAGEdit,这是一个 无需训练 框架,用于具有强时间一致性的细粒度多对象视频编辑。该框架采用布局引导注意力调制来促进连贯的多对象编辑,同时引入实例级掩模来保留单个对象身份并在每个对象区域内强制执行局部注意力,从而实现细粒度的对象级编辑。广泛的定性和定量评估表明,我们的方法比最先进的视频编辑方法提高了时间稳定性和多对象可控性。