论文
重新思考位置嵌入作为多参考和多镜头视频生成的上下文控制器
Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video Generation
摘要
最近的专有模型(例如 Sora2)在生成以多个参考角色为条件的多镜头视频方面取得了可喜的进展。然而,学术界对此问题的研究仍然有限。我们研究这个任务并确定一个核心挑战:当参考图像表现出高度相似的外观时,模型经常会遇到参考混淆,其中语义相似的标记会降低模型检索正确上下文的能力。为了解决这个问题,我们引入了 PoCo(位置嵌入作为上下文控制器),它将位置编码作为语义检索之外的附加上下文控制。通过利用词元的辅助信息,PoCo 可以实现精确的 词元级 匹配,同时保留隐式语义一致性建模。在 PoCo 的基础上,我们开发了一种多参考和多镜头视频生成模型,能够可靠地控制具有极其相似视觉特征的角色。大量实验表明,与各种基线相比,PoCo 提高了交叉镜头一致性和参考保真度。