论文
OmniMate:用于交互式化身的开放式实时流媒体视听生成
OmniMate: Open-Ended Real-Time Streaming Audio-Visual Generation for Interactive Avatars
摘要
基于扩散的生成模型的最新进展使得实时音频驱动的化身生成和统一的视听合成成为可能,为交互式化身系统提供了有希望的基础。然而,将统一的视听合成扩展到实时交互式流媒体仍然具有挑战性,因为生成范围事先未知,并且生成的身份可能会在长期生成过程中发生漂移。为了应对这些挑战,我们提出了 OmniMate,这是一个用于开放式实时交互式视听化身生成的统一框架。 OmniMate 实时联合合成视觉内容、语音和音效,实现自然、沉浸式的多轮交互。为了实现自适应响应进度,我们引入了生成进度控制器(GPC),它显式地模拟每个流块的生成进度,允许模型根据期望的进度完成响应,并实现执行和监听状态之间的无缝转换。为了保持长期的跨模式身份一致性,我们提出了一个多参考调节模块(MRCM),它利用多个参考图像和参考语音片段在整个长时间的流媒体交互中提供持久的视觉和说话者身份线索。对 VerseBench 面向交互的改编进行的大量实验表明,OmniMate 实现了高质量、低延迟的流生成,同时保持了强大的长期视听一致性。结果进一步表明,OmniMate 支持在扩展的多轮对话中提供逼真、连贯且响应灵敏的交互式化身体验。