论文
IndicFDB:跨印度语言的全双工语音Agent基准测试
IndicFDB: Benchmarking Full-Duplex Voice Agents across Indian Languages
摘要
全双工语音Agent必须处理暂停、轮流、反向通道并实时响应用户中断。 Full-Duplex-Bench 评估这些行为,但其纯英语语料库以及对单词时间戳 ASR 和英语提示的 LLM 评审的依赖使其难以扩展到印度语言。我们引入了 IndicFDB,它将其扩展到印度使用的 10 种语言,拥有 12,350 个样本,几乎是原始样本的 17 倍。我们解决了三个挑战:在多语言语音中查找对话事件,在没有可靠的词级对齐的情况下评估它们的时间,以及判断跨语言的响应。我们使用语音活动检测 (VAD) 从大约 50,000 小时的频道分隔对话中挖掘暂停处理、轮流和反向通道样本,并构建经过人工验证的合成用户中断样本。独立于语言的 VAD 启发式评估时间安排,而开放权重转录和翻译管道将响应转换为英语,以获得 LLM 的相关性和质量评级。在七种语音Agent中,商业 API 在不同语言中表现出出乎意料的一致行为,但要么快速,要么对暂停鲁棒,而不是两者兼而有之,而单语言开放全双工模型则暴露了反向通道、响应质量和延迟之间的进一步权衡。