论文
用于保留身份的文本到视频生成的时空解耦参考调节
Spatial-Temporal Decoupled Reference Conditioning for Identity-Preserving Text-to-Video Generation
摘要
身份保留视频生成(IPVG)旨在合成遵循文本提示的高保真视频,同时忠实地保留参考身份。尽管最近取得了进展,现有的 IPVG 方法仍然难以平衡高级语义控制和底层身份保真度。为了弥补这一差距,我们提出了 ST-DRC,这是一种有效的时空解耦参考调节框架,用于保存身份的文本到视频生成。在框架级别,ST-DRC 通过将参考图像与视频 VAE 进行编码并将其与噪声视频潜在特征连接起来,执行潜在的上下文特征注入,从而无需额外的适配器即可访问丰富的底层身份详细信息。为了将身份感知参考检索与外观复制分开,我们引入了 TASS-RoPE,这是一种时间相邻空间移位 RoPE 方案,该方案将参考标记在时间上放置在视频序列附近,但在空间上移动它们,允许参考信息通过时空注意力流动,同时抑制像素级复制粘贴快捷方式。为了进一步防止捷径学习并加强扩散目标中稀释的身份监督,我们将外观不变的参考增强与面部引导的身份目标相结合,鼓励模型在颜色、姿势和布局变化的情况下保留身份。在推理时,我们引入了一种三流无参考分类器的指导策略,该策略独立控制文本依从性和参考保真度。实验表明,ST-DRC 通过基于 LTX-2.3 的轻量级设计实现了强大的身份保留、及时对齐、时间一致性和视频质量。我们的方法在面部身份保留视频生成赛道中名列前茅,验证了时空解耦参考调节的有效性。