论文
TaoMate:锚定引导的记忆桥接进化和参考状态,用于实时音频-视频数字人类生成
TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation
摘要
实时长格式数字人类生成依赖于因果模型来扩展视听内容,同时保留连续片段之间的主题外观和音视频同步。有界缓存保留本地运动和语音上下文,但丢弃较旧的证据,而关注完整生成的历史记录的计算成本很高,并且可能会传播累积的错误。我们提出了 \method,一种用于少步联合音频视频生成的锚引导持久记忆框架。该框架保留了不可变的视觉锚点,将完整的视频和音频块压缩为固定容量的动态状态,并通过特定于模态的剩余注意力检索这些状态,而无需扩展活动缓存。参考感知调制方法还根据动态和锚点外观统计来调节视频特征。锚点保留因果上下文 蒸馏 会改变生成轨迹长度、前缀来源和缓存历史可靠性,同时保持不可变的视觉锚点不受干扰。通过将持久内存与阶段局部去噪依赖性分开,该方法进一步允许跨块的阶段并行执行,从而加速自回归推理,而无需特定于管道的重新训练。我们通过外观、时间、同步、面部和语音诊断来评估长视频连续性。结果表明,该方法在自回归生成下保持了提示条件片段的稳定外观和强大的视听同步。我们的项目页面是 https://taoliveaigc.github.io/TaoMate。