论文
Audio2Tool:说话、通话、行动——用于语音工具使用基准测试的数据集
Audio2Tool: Speak, Call, Act -- A Dataset for Benchmarking Speech Tool Use
摘要
语音助手越来越依赖语音语言模型 (SpeechLM) 来解释语音查询并执行复杂的任务,但现有基准缺乏领域广度、声学多样性和组合推理复杂性来评估工具调用性能。我们引入了 Audio2Tool,这是一个包含大约 30,000 个查询的大型数据集,旨在评估 SpeechLM 跨三个主要领域的工具调用能力:智能汽车、智能家居和可穿戴设备。我们的基准测试具有多层复杂性层次结构,从简单的直接命令到复杂的多意图和大海捞针提取以隔离不同的故障模式。为了确保真实感,我们采用零样本语音克隆文本到语音合成和不同的噪声配置文件来模拟野外条件。对最先进的 SpeechLM 和 ASR-LLM 管道的评估显示,在简单命令上表现强劲,但在构图和声学挑战下性能显着下降。代码和数据集可在项目页面上公开获取:https://audio2tool.github.io/。