论文
Full-Duplex-Bench-v3:现实世界不流畅情况下全双工语音代理的基准测试工具使用
Full-Duplex-Bench-v3: Benchmarking Tool Use for Full-Duplex Voice Agents Under Real-World Disfluency
摘要
我们引入了 Full-Duplex-Bench-v3 (FDB-v3),这是一个在自然语音条件和多步骤工具使用下评估口语模型的基准。与之前的工作不同,我们的数据集完全由真实的人类音频组成,注释了五个不流畅类别,并与需要跨四个任务域进行链式 API 调用的场景配对。我们评估了六种模型配置——GPT-Realtime、Gemini Live 2.5、Gemini Live 3.1、Grok、Ultravox v0.7 和传统级联管道 (Whisper$\rightarrow$GPT-4o$\rightarrow$TTS)——涵盖准确性、延迟和轮流维度。 GPT-Realtime 在 Pass@1 (0.600) 和中断避免 (13.5%) 上领先; Gemini Live 3.1实现了最快的延迟(4.25~s)但最低的轮询率(78.0%);级联基线尽管具有完美的轮流率,但会产生最高的延迟(10.12~s)。在所有系统中,困难场景下的自我纠正处理和多步推理仍然是最一致的故障模式。