论文
Agentic-ger:使用全局上下文进行长篇语音中的术语恢复
agentic-ger: terminology recovery in long-form speech using global context
摘要
语音语言模型的最新进展改进了长格式音频的自动语音识别 (ASR)。然而,准确一致地转录特定领域的术语仍然具有挑战性。受大型语言模型 (LLM) 的世界知识和上下文能力的推动,我们提出了 Agentic-GER,这是一种基于 LLM 的代理,用于长格式语音中的术语校正。该代理使用完整记录中的全局上下文来识别可疑术语并解决模棱两可的假设。它有选择地重新转录源语音以检查候选更正,并使用已接受的编辑来指导后续决策。在 GigaSpeechBench 上对四个大语言模型和两个 ASR 系统进行的实验表明,无论有没有思考,中文和英文的术语都有一致的改进。在中文语音方面,与 Whisper 基线相比,Agentic-GER 的偏差字符错误率 (B-CER) 相对降低了 36.8%。