论文
DuplexSpeechBench-文档grounding:语音Agent中文档grounding和幻觉的基准测试
DuplexSpeechBench-Document Grounding: Benchmarking Document Grounding and Hallucinations in Voice Agents
摘要
语音Agent可实现低延迟、自然的交互,但它们在外部文档中忠实响应的能力仍未得到充分探索。我们推出 DuplexSpeechBench-Document Grounding (DSB-DG),这是一个评估五个专业领域语音Agent文档grounding的基准。 DSB-DG 针对三种故障模式: 上下文饱和度,测量文档长度不断增加的情况下的grounding情况; Grounding Decay,衡量多轮对话中文档事实的保留情况;主动grounding,评估上下文重新注入是否可以减轻对话漂移。该基准包含来自覆盖五个专业领域的 50 个文档的 1,636 个经过对抗性验证的 QA 对,并支持对grounding精度、幻觉和响应延迟的全自动评估。在跨越级联、专有全双工和实时以及开放权重语音到语音架构的系统中,我们发现有效grounding能力存在显着差异。虽然级联管道 (ASR-LLM-TTS) 实现了最高的grounding精度,但 Gemini-Live 和 GPT-Realtime 紧随其后。开重系统表现出独特的故障模式,最显着的是突然的环境容量崩溃和多匝grounding衰减。更广泛地说,基础保真度会随着上下文和对话负载而降低,失败通常表现为不受支持的生成而不是弃权。我们表明,上下文基础是可靠的全双工语音Agent尚未解决的关键挑战。