论文

小米-CocktailASR-1技术报告

Xiaomi-CocktailASR-1 Technical Report

模型架构新型架构

摘要

最近,基于大语言模型(LLM)的ASR模型取得了重大进展,但它们普遍缺乏对多说话人场景的支持,其中鸡尾酒会问题仍然是进一步推进ASR的关键瓶颈。现有的 TS-ASR 方法,包括具有说话人嵌入的端到端架构和最新的基于 LLM 的探索,都存在单说话人性能下降以及当目标说话人不存在时无法拒绝的问题。在本文中,我们提出了Xiaomi-CocktailASR-1,一种基于LLM的端到端TS-ASR架构。利用参考语音作为声纹提示,直接转录目标说话人的语音,无需语音分离。小米-CocktailASR-1在单说话人场景下保持具有竞争力的性能,可与主流ASR型号相媲美。它还具有负样本拒绝功能,当混合语音中不存在目标说话者时,输出空文本。此外,Xiaomi-CocktailASR-1支持思想链(CoT)推理模式,以提供明确的推理步骤。对各种合成和真实多说话人基准的大量实验表明,Xiaomi-CocktailASR-1 实现了最先进的性能,通过平衡多说话人和单说话人识别准确性以及拒绝能力的统一架构,有效解决了鸡尾酒会问题。