论文
检索更好,鲁棒性更差:多跳 RAG 如何放大上游 ASR 错误
Better Retrieval, Worse Robustness: How Multi-hop RAG Amplifies Upstream ASR Errors
摘要
基于语音的应用程序在任何检索模块之前通过自动语音识别 (ASR) 传递语音查询,因此 ASR 错误作为固定的上游约束进入管道。我们凭经验测试标准检索增强生成(RAG)、实体图链接和迭代重构的两种扩展是否吸收或放大了这些错误。使用通过神经 TTS 合成的四种英语口音,我们在三个多跳 QA 基准(HotpotQA、2WikiMultiHopQA 和 MuSiQue)上针对纯文本预言机评估了四种 RAG 配置。尽管结构更丰富的配置通常在 ASR 输入下保留较高的绝对 F1,但这两种扩展都会放大误差:在所有三个基准上,它们的组合下从干净文本到最高 WER 口音的 F1 差距比朴素密集检索下的 F1 差距大 36-67%。主要故障模式是一个或多个查询实体的损坏,占所有四种方法中 2WikiMultiHopQA 降级案例的 87-96%。两个轻量级表面形式缓解措施使大部分间隙完好无损,表明下游检索结构放大了剩余的实体错误。我们在 https://github.com/Continuum-AI-Corp/spoken-multihop-rag 发布代码和数据。