论文

Motion-Omni:用于口语对话的端到端联合语音和全身运动

Motion-Omni: End-to-End Joint Speech and Full-Body Motion for Spoken Dialogue

应用与实践语音交互与综合语音服务

摘要

进行对话的化身应该决定说什么以及在说话时移动,但这些能力存在于不同的模型系列中:口语对话模型产生没有运动的语音,而共同语音运动模型仅根据传递给它们的音频产生运动。标准补救措施是级联,首先生成语音响应,然后在完成的音频上运行运动模型,这需要第二次完整的推理过程,并排除两者之间的任何联合优化。我们提出了 Motion-Omni,这是一个端到端框架,其中语音对话模型本机输出明确的面部表情以及手部、上半身和下半身运动,直接从产生语音的隐藏状态生成。联合训练在这里不是可选的:在语音通路冻结的情况下,运动仍然与音频不对齐,并且在两个目标下共同调整 LLM、语音生成器和运动生成器可以在保留口语对话能力的同时恢复对齐。监督来自于一个可扩展的、与模型无关的管道,该管道使用可替换的运动教师对一致的语音语音响应进行伪标记,产生 422,856 个质量排名对(1,402 小时)。我们进一步发布了 SwDA-500,据我们所知,这是第一个用于随机开放式全身口语对话的公共评估协议,在统一渲染、自动指标、人工评估和延迟测量的同时跨运动系统匹配音频。 Motion-Omni-Q7 使用 Qwen2.5-7B-Instruct 主干进行实例化,在无参考运动指标上将相同音频教师级联匹配到 2% 以内,同时响应速度提高 5.4 倍(RTF=0.78,比实时更快),在节拍相关性和多样性方面超越所有非教师级联,并达到 2.62% 的单词错误率,这是全模态系统中最低的。