论文

RefAlign:视频参考生成的表示对齐

RefAlign: Representation Alignment for Reference-to-Video Generation

应用与实践内容创作

摘要

参考视频(R2V)生成是一种可控视频合成范例,它使用文本提示和参考图像来约束生成过程,从而支持个性化广告和虚拟试穿等应用。在实践中,现有的 R2V 方法通常会在参考图像的 VAE 潜在表示旁边引入额外的高级语义或跨模态特征,并将它们联合输入到扩散 Transformer (DiT) 中。这些辅助表示提供语义指导并充当隐式对齐信号,可以部分减轻 VAE 潜在空间中的像素级信息泄漏。然而,他们可能仍然难以解决由于异构编码器功能之间的模态不匹配而导致的复制粘贴伪影和多主体混淆。在本文中,我们提出了 RefAlign,一种表示对齐框架,可将 DiT 参考分支特征显式对齐到视觉基础模型 (VFM) 的语义空间。 RefAlign的核心是参考对齐损失,将同一主题的参考特征和VFM特征拉近以提高身份一致性,同时推开不同主题的相应特征以增强语义可辨别性。这种简单而有效的策略仅在训练期间应用,不会产生推理时间开销,并且在文本可控性和参考保真度之间实现了更好的平衡。 OpenS2V-Eval 基准测试的大量实验表明,RefAlign 在 TotalScore 中优于当前最先进的方法,验证了 R2V 任务的显式参考对齐的有效性。