论文
Gloria:通过内容锚点生成一致的角色视频
Gloria: Consistent Character Video Generation via Content Anchors
摘要
数字角色是现代媒体的核心,但生成具有长时间、一致的多视图外观和富有表现力的身份的角色视频仍然具有挑战性。现有的方法要么提供足够的上下文来保留身份,要么利用非以字符为中心的信息作为记忆,导致一致性不佳。认识到角色视频生成本质上类似于从外观看的场景。在这项工作中,我们建议通过一组紧凑的锚框来表示角色视觉属性。这种设计提供了稳定的参考以实现一致性,而基于参考的视频生成本质上面临着复制粘贴和多参考冲突的挑战。为了解决这些问题,我们引入了两种机制:超级集内容锚定(Superset Content Anchoring),提供训练内和训练外剪辑提示以防止重复;以及 RoPE 作为弱条件(Weak Condition),编码位置偏移以区分多个锚点。此外,我们构建了一个可扩展的管道来从大量视频中提取这些锚点。实验表明,我们的方法生成了超过 10 分钟的高质量角色视频,并实现了跨视图的表达身份和外观一致性,超越了现有方法。