论文
EmbodiedHead:对话代理的实时听说化身
EmbodiedHead: Real-Time Listening and Speaking Avatar for Conversational Agents
摘要
我们推出了 EmbodiedHead,这是一种语音驱动的头部说话框架,为 LLM 配备了用于对话的实时视觉化身。一个实用的实体化身必须同时实现实时生成、统一听说行为和高渲染视觉质量。我们的框架将用于此任务的第一个整流流扩散 Transformer (DiT) 与可微分渲染器结合起来,只需四个采样步骤即可实现多样化的高保真生成。先前的听-说方法依赖于双流音频,引入了与因果用户 LLM 交互不兼容的对话者前瞻依赖性。相反,我们采用单流接口,具有明确的每帧听-说状态调节和流音频调度器,在收听过程中抑制虚假的嘴部运动,同时实现无缝轮流。系数空间预训练和联合图像域细化的两阶段训练方案进一步缩小了运动级监督和渲染质量之间的差距。大量实验证明了口语和听力场景中最先进的视觉质量和运动保真度。