论文

$τ$-多语言:跨语言的语音代理基准测试

$τ$-Multilingual: Benchmarking Voice Agents Across Languages

智能体系统Agent任务评测

摘要

纯英语基准仅暴露了语音Agent行为的一小部分。我们推出了 $τ$-Multilingual,将 $τ$-Voice 扩展到西班牙语、巴西葡萄牙语、印地语、韩语和普通话,并通过母语人士对生成的语言和口语输出进行审查和评估。在 4,500 个全双工呼叫和五种语音配置中,西班牙语、葡萄牙语和印地语的任务完成分与英语的差距保持在 3.2 分之内,但韩语和普通话则分别下降了 14.7 分和 8.4 分。故障模式也各不相同:韩语系统错过更多响应,普通话系统更频繁中断,并且都与工具和实体作斗争。 Grok 在任务完成方面领先,但在生成质量、激励单独任务、交互和生成报告方面得分最低。我们发布语言包、经过验证的评审以及用于社区构建的多语言语音Agent评估的工具。