论文

AVTR-1:实时交互式头像的开放堆栈

AVTR-1: Open Stack for Real-Time Interactive Avatars

AI 基础设施推理服务

摘要

说话头和二元模型现在可以实现实时推理,但仅快速运动生成并不能产生交互式对话。实时系统必须将模型的输出与外部语音代理的语音同步、安排视频帧播放并处理中断。我们推出了 AVTR-1,这是一个用于实时交互式头像对话的开放堆栈,围绕一个紧凑的 153M 参数自回归流匹配运动生成器构建,以参与者的音频为条件。我们调整其音频编码器以通过自蒸馏进行流式传输。该堆栈将模型基于块的生成转换为由外部语音代理驱动的连续、同步的音频视频流,我们通过分析得出其对面向用户的延迟的贡献,并使用两个商业语音代理验证结果范围。进一步的实验表明,AVTR-1 在所有报告的视觉质量指标和最传统的听觉运动指标上领先于比较的二元系统,同时在唇同步方面保持竞争力。其推理运行时在数据中心和消费者 GPU 上实时运行。然而,传统的听力指标并不能确定配对说话者的语音是否有助于生成运动。因此,我们引入了基于参考的定向格兰杰增益(R-DGG),它在考虑听众历史和说话者运动后测量说话者语音携带的附加预测信息。 R-DGG 发现了记录的听众和所有评估的二元系统的统计支持的预测依赖性,但不适用于没有配对音频或不匹配的说话者-听众对的头部说话生成器。我们根据组件特定的许可证发布模型权重、渲染器和服务后端。