论文

TASTE2:面向全双工语音交互的文本对齐语音建模和部署

TASTE2: Text-Aligned Speech Modeling and Deployment toward Full-Duplex Voice Interaction

模型架构新型架构

摘要

全双工语音交互需要的不仅仅是话语级转换。它必须处理流式语音、管理轮流和中断,同时保留预先训练的语言能力和声学副语言线索。我们询问 TASTE(文本对齐语音标记化和嵌入)是否为实现这一目标提供了可行的途径。我们提出了 TASTE2,它将话语级 TASTE 转换为增量对话堆栈。共享的文本标记词汇消除了词级平均,而模态对齐的对话训练可以预测每个文本标记的一个连续潜在音频,而无需交错异构标记流。增量语音 Detokenizer 可通过 CosyVoice2 进行流合成。语音和对话训练后,TASTE2(合并)在 LLaMA-Questions 上达到 56.3%,而 Qwen2.5-7B Instruct 纯文本参考为 57.3%(准确度保留率为 98.2%),TASTE2(直接)达到 53.0%(保留率为 92.4%)。我们构建了 TASTE2 VoiceBot,它可以增量处理用户语音、流式传输合成音频并在插入时停止生成。在 Full-Duplex-Bench v1.0 上,TASTE2 和 TASTE2 VoiceBot 可以很好地处理中断,同时保持较高的对话连贯性。自然对话仍然具有挑战性,在 TensorRT 加速后,在两台 NVIDIA RTX A6000 上部署时,首次发出音频的平均时间为 2.701 秒。最后,据我们所知,我们在基于味觉的模型中首次系统地描述了显式副语言控制。快速语速可以作为对话 SFT 后的跨策略概念证明,而情绪控制则依赖于策略,其余属性仍然较弱。总之,这些结果将基于 TASTE 的建模建立为实现全双工系统的实用途径,同时识别自然对话的鲁棒性、语音生成延迟,并将一般副语言控制作为开放挑战。在线探索 TASTE2。