论文

MultiTalk:将全双工语音模型扩展到长时间、多方、双语对话

MultiTalk: Scaling Full-Duplex Speech Models to Long, Multi-Party, Bilingual Conversation

模型训练预训练

摘要

端到端全双工语音模型使开源机器对话更接近人类交互,但现有系统在两个相互交织的维度上仍然受到限制:长上下文鲁棒性和多方交互。会议、小组课程和社交机器人接待等现实场景需要单一模型来长时间跟踪、情境化和响应多个发言者。进展受到数据和评估的限制:开放多方语音语料库仍然很小,并且不是为编解码器帧级全双工建模而设计的,而现有的长音频基准侧重于被动聆听,而语音到语音基准大多较短且二元。我们沿着英语和汉语的长视野和多方轴线共同扩展莫希范式。首先,我们发布了 57.6k 小时的合成训练数据($\href{https://huggingface.co/datasets/MultiTalk/MultiTalkPT}{MultiTalkPT}$ 和 $\href{https://huggingface.co/datasets/MultiTalk/MultiTalkFT}{MultiTalkFT}$) 用于长篇、多方、英汉全双工对话,具有可控的长度、参与者数量、轮流、重叠、反向渠道、中断、收件人转移和远程共指。其次,我们介绍$\href{https://huggingface.co/datasets/MultiTalk/MultiTalkBench}{MultiTalkBench}$, 根据真实的人类录音构建,用于评估平均 32.6 分钟的长篇、多方、双语全双工对话,包括对远程实体跟踪、主题连贯性和收件人选择的探测。 MultiTalkBench 上的 MiniCPM-o-4.5 和 Qwen3-Omni-30B-A3B-Instruct。