论文

用于代理语音识别的语音记忆

Voice Memory for Agentic Speech Recognition

摘要

我们提出了语音记忆(Voice Memory),这是一种用于代理语音识别的仅推理方案:在流传输时,冻结的校正器读取单个每个域的记忆.md,并决定每个话语是按照假设行事还是放弃并保留 1-best。异步地,分数门控优化器通过有界编辑来修改该文件,仅当它严格提高保留的分数时才接受编辑。扩展自经典的ASR-LM框架,我们将这种分裂的聆听者-思考者架构称为“聆听者-思考者”架构;这两个角色仅通过记忆耦合,因此权重不会改变,并且学到的技能保持可审核和可移植。事实证明,约束是该循环发现的操作技巧:无约束生成错误纠正 (GER) 会过度纠正,在财经新闻编辑中高达 64% 的错误标记被破坏,而语音记忆则将该比率降低至 35%。在使用开放式校正器 Voice Memory 的 10 个 HyPoradise 领域中,将加权单词错误率从 8.36% 降低到 7.52%(添加了三个上下文示例后为 7.47%),且不会使任何数据集回归低于其 1 最佳基线;增益集中在可恢复余量最大的地方,包括空中旅行命令(8.40%至3.40%)和嘈杂的远场语音(CHiME-4,12.69%至10.46%)。内存跨校正器系列传输并向推理路径添加零参数。提供了演示和示例代码以供将来的研究使用。