论文
HarmoView:协调多视图约束以生成身份一致的视频
HarmoView: Harmonizing Multi-View Constraints for Identity-Consistent Video Generation
摘要
当前的身份一致视频生成方法很难在较大的视点变化下保持外观保真度。虽然引入多视图参考输入提供了一个自然的解决方案,但由于缺乏多视图输入的有效框架和多视图数据的稀缺,进展仍然受到限制。我们通过提出 HarmoView 来应对这些挑战,这是一个用于生成身份一致视频的强大框架,通过三个架构改进并辅以分阶段训练课程,有效地集成多视图线索。具体来说,我们首先引入多级特征注入来锚定身份保真度;通过交叉注意力注入来自正面引用的原始 ViT 特征以及文本标记,MFI 提供了持久的底层外观锚点,补充了 DiT 块内的高级身份特征,从而增强了身份保留。然后,我们采用可学习的代理词元来统一单/多视图设置中的异构参考布局,同时解决参考视图不匹配问题。 Jump-RoPE 进一步开发用于身份明智的特征隔离,以减少身份串扰。为了激活这些结构能力,同时保留原始的生成先验,我们提出了渐进式视图课程。这种四阶段训练策略采用视图丢失来促进从普通 T2V 生成到高保真、身份持久空间推理的稳定过渡。此外,我们构建了一个大规模的多视图数据集来解决数据稀缺的问题。对我们的多视图基准的广泛评估(包括涵盖 52 个独特身份的 100 个手动策划的案例)表明,HarmoView 的性能显着优于开源基准,并与领先的闭源引擎相匹配,在身份一致的视频生成方面实现了最先进的性能。