论文
FlowMimic:使用像素对扭曲流场进行无掩模视觉编辑和生成,用于在线视频编辑数据生成和模态模仿
FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry
摘要
根据视觉研究的流行方向,我们探索在单个模型中集成视频和图像模式的生成和编辑功能。目前收集视频编辑数据的方法通常依赖于劳动密集型、耗时的策划程序,包括对象掩模注释、通过 I2V 模型和类似 ControlNet 的指导使用引入错误的对合成,以及基于 VLM 的质量过滤或细化,并且任务可扩展性有限。因此,编辑任务的多样性仍然比图像编辑模型可用的多样性要窄得多。我们开发了一种像素对时间扭曲流场,可以直接从图像编辑样本实时生成相应的视频编辑样本,并且我们在多个级别的视频编辑任务中证明模型可以仅使用此类数据来学习视频编辑。我们将图像模态视为视频模态的一种特殊形式。因此,我们设计了模态模拟生成损失和模态模拟编辑损失,以通过相互模仿来相对调整两种模态的能力,从而调整输出分布。此外,基于语言的可视编辑需要理解编辑指令和参考可视内容、在参考可视内容内定位与该指令相对应的区域以及单独修改该区域。现有方法主要依赖于外部辅助,例如 微调 附加 MLLM 或在推理期间显式提供掩码序列作为辅助输入。相反,我们希望模型能够内化这种能力。为此,我们引入了与感觉相关的任务(例如,引用表达分割)以及相应的编辑区域感知潜在水平损失和注意力水平损失。