论文

InteractiveAvatar:实时流媒体视频生成,实现一致且具有意图感知的化身

InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars

应用与实践内容创作

摘要

最近的基于扩散的模型已经能够在实时流媒体中生成逼真的音频驱动的化身。然而,现有的方法很难保持视觉时间一致性,并且无法在复杂的交互式流媒体场景中明确感知用户意图。为了应对这些挑战,我们提出了 InteractiveAvatar,这是一种实时无限流视频生成框架,支持视觉一致的头像视频生成和意图感知交互。借助自回归 蒸馏,InteractiveAvatar 可以在任意长的持续时间内实时流式生成人类头像。为了视觉一致性,我们引入了长短视觉记忆(LSVM)机制,可以灵活地将历史视觉信息压缩为紧凑的标记,从而保持短期连贯性和长期一致性。为了生成具有与用户意图一致的语音和动作的化身,我们提出了推理反应模块(RRM),它结合了状态循环策略和缓存切换机制。在不同场景下的广泛实验结果表明,我们的方法在长时间生成中实现了最先进的视觉一致性,同时实现了复杂的用户与头像交互。