论文
在视频生成中实现动态主题集的主题一致性
Towards Subject Consistency over Dynamic Subject Sets in Video Generation
摘要
我们认为,随着视频生成的持续时间更长,应该在 dynamic subject sets 上评估主题一致性。因此,我们引入了 DynSC-Eval,这是一个评估框架,可以在合格主体的整个可见生命周期中动态跟踪合格主体,并使用六个互补的对象级指标来衡量局部连续性和全局身份保留,并明确检测不一致事件。为了验证其有效性,我们设计了主动注入不一致事件的综合实验,证明了 DynSC-Eval 的敏感性和现有指标的局限性。对 5 秒、15 秒和 60 秒视频生成的不同模型的评估进一步揭示了传统指标所掩盖的实质性主题一致性差异。除了评估之外,我们还从 DynSC-Eval 构建奖励,并在自动驾驶测试台中应用 DiffusionNFT 后训练。在 5s 代上,我们的方法将 Wan-2.1-1.3B 的六个不一致性指标平均减少了 13.82%,SANA-2B 平均减少了 5.66%,在 I2V 模型 ReSim 上也观察到了改进。定性比较进一步证明了我们方法的有效性。然后,我们通过课程学习将世代扩展到 10 岁和 30 岁,并表明一致性优化仍然有效,同时在很大程度上保留了其他能力。