论文

VibeVoice-ASR-Streaming技术报告

VibeVoice-ASR-Streaming Technical Report

应用与实践语音识别与转写

摘要

传统带说话人归属的自动语音识别将转录和说话人分离视为两项任务,VibeVoice-ASR等端到端模型已将其统一,但主要支持离线识别,难以满足实时语音助手及智能体的低延迟要求。VibeVoice-ASR-Streaming是较早基于大模型实现端到端流式说话人归属语音识别的方法之一,交错固定大小音频块、少量前瞻音频及先前文本,语音到达时即可输出“谁说了什么”,无需独立说话人分离阶段。7B模型在五个评估集的平均词错误率或字错误率最低,13项说话人归属设置中12项最佳或并列最佳。发布1.5B、7B权重与推理代码。