论文

用于连续动作视频生成的关键帧锚定身份保留

Keyframe-Anchored Identity Preservation for Sequential-Action Video Generation

应用与实践内容创作

摘要

保留身份的文本到视频生成旨在合成准确遵循文本描述的视频,同时始终保持用户指定主题的可识别性。 IPVG26 挑战将该框架从单一整体提示扩展为时序结构化规范。该模型还接收一系列带时间戳的动作描述,并且必须渲染按指定顺序执行这些动作的主体。这种时间结构提出了以前的身份保留生成任务中未遇到的挑战,因为主体必须连续执行不同动作的脚本序列,同时保持一致的身份。然而,随着运动的积累和所描绘的动作的变化,端到端视频生成器很容易出现外观漂移。我们通过 无需训练 三级管道框架来应对这一挑战。动作感知提示完善阶段首先将输入重写为图像生成提示,指定每个动作的最终状态。然后,身份保留生成阶段通过根据参考身份及其前身联合调节每个帧来生成关键帧序列,从而将时不变外观与时变姿势解耦。最后,身份感知推理增强阶段使用多参考指导和身份驱动噪声搜索来合成中间片段,这两者都增强了采样期间的身份保真度。我们的方法在官方 Track 2 排行榜上排名第三,展示了具有竞争力的性能和很强的通用性。