论文

HearInContext:语音识别中隐式上下文的基准

HearInContext: A Benchmark for Implicit Context in Speech Recognition

模型评测基准与评测资源

摘要

上下文 ASR 可以受益于语义提示或上下文中明确提供的目标词。我们推出了 HearInContext,这是一个普通话-英语基准测试,它将共享的合成语音与支持不同解释的助理回复配对。该基准测试包含 3,764 个围绕同音词构建的语义测试用例。隐式上下文排除候选词;显式上下文命名目标。无上下文和无关上下文控制衡量相关历史的好处和对不相关历史的敏感性。具有上下文功能的模型受益于隐式提示,但通过显式提示实现更高的目标召回率。微调 Qwen3-ASR-1.7B 将普通话和英语的隐式上下文目标召回率提高了 11.4 个百分点,而 AISHELL-1 和 LibriSpeech 上的绝对 CER/WER 变化仍低于 0.1 个百分点。收益扩展到排除微调的明确条件以及真实录音的普通话热词识别。代码和数据可在 https://github.com/OPPO-Mente-Lab/HearInContext 获取