论文

通过元数据驱动的推理链,通过语音 LLM 的 ASR 广泛描述实现深层语境推理

Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains

模型训练监督微调与指令调优

摘要

语音识别通常无法识别罕见的特定领域术语和上下文相关的命名实体。现有的情境化技术通常偏向使用关键字或短语列表进行解码,这不能很好地扩展或利用更深入的知识。我们提出了一种训练方法,教语音 LLM 使用广泛的描述(例如来自视频)作为弱语义先验来执行基于音频的上下文推理。我们通过将错误的假设与视频元数据和 LLM 生成的推理解释配对来构建 400 小时的推理增强语音数据,以证明上下文驱动的纠正是正确的。我们对语音 LLM 进行微调以执行思想链推理:生成初始转录本,然后根据上下文进行推理,最后返回正确的转录本。在保留的 YouTube 衍生测试集上,我们的方法减少了错误,对稀有单词和命名实体进行了具体改进,并为语音识别中更深入的上下文推理奠定了基础。