论文

Qwen-Audio-3.0-ASR 技术报告

Qwen-Audio-3.0-ASR Technical Report

模型训练预训练

摘要

近年来,自动语音识别 (ASR) 见证了由三个互补范例驱动的变革性进步:数据扩展、模型扩展以及与 大语言模型 (LLM) 的深度集成。然而,弥合学术基准表现和现实世界生产效用之间的差距仍然是一个持续存在的挑战,特别是在处理不同的地区方言、动态实体和热词、远程上下文信息和不流利的自发语音方面。在本报告中,我们介绍了 Qwen-Audio-3.0-ASR,这是一种基于专家混合 (MoE) LLM 的 ASR 系统,旨在通过统一的指令跟踪框架来满足这些制作需求。该模型建立在 Qwen 主干之上,并经过数千万小时的大规模语音数据训练。 Qwen-Audio-3.0-ASR 支持跨 8 个主要方言区的 30 种语言和 16 个汉语方言变体的转录。除了多语言和方言识别之外,该模型还提供面向生产的功能,包括行业领域实体识别、分层热词定制、本机单通道转录抛光和长音频上下文建模。我们进一步为延迟敏感的应用程序开发了专用的流媒体变体 Qwen-Audio-3.0-ASR-Streaming。对中文、英文、多语言和真实世界工业测试集的广泛评估表明,在广泛的评估条件下,其识别性能处于最先进或极具竞争力的水平,相对于包括 GPT-4o Transcribe 和 Gemini 3.1 Pro 在内的领先商业和专有系统,其性能表现强劲。