论文

从密集预测到可视化编辑:统一图像和视频创建的结构化监督

From Dense Prediction to Visual Editing: Structured Supervision for Unified Image and Video Creation

模型训练监督微调与指令调优

摘要

统一的图像和视频创建需要模型遵循不同的指令,同时保留视觉上下文中的身份、几何形状和时间结构。然而,仅语义调节和仅创建训练并不能明确监督精确、时间一致的编辑所需的局部结构。因此,我们将深度和表面法线预测制定为图像形式的去噪目标,使用这些密集任务作为同一创建界面中的结构化视觉监督。我们的框架将语义解释与空间对齐的视觉注入分离,同时在所有任务中共享一个多模态扩散 Transformer (MMDiT) 主干。然后,相互上下文注意(MCA)、配对视频数据构建过程和渐进式训练课程将学习到的结构线索与时间本地化编辑和参考条件创建联系起来。在报告的统一系统比较中,单个检查点获得最高总分(4.15);添加密集监督将 OpenVE 整体性能从 3.98 提高到 4.06,局部添加性能从 3.92 提高到 4.18。这些结果支持了一个刻意限制的结论:面向感知的密集监督将有用的结构知识转移到下游创作,特别是编辑局部性和保存;我们并不声称作为独立的密集预测器具有优越性。