论文

从文本到语音:用于评估工具调用 LLM 代理的可重复且可验证的框架

From Text to Voice: A Reproducible and Verifiable Framework for Evaluating Tool Calling LLM Agents

智能体系统Agent任务评测

摘要

语音代理越来越需要通过语音可靠地使用工具,而突出的工具调用基准仍然基于文本。我们研究是否可以将经过验证的文本基准转换为受控的基于音频的工具调用评估,而无需重新注释工具模式和黄金标签。我们的数据集无关框架使用文本到语音、说话者变化和环境噪声来创建配对的文本音频实例,同时保留原始数据集注释。基于对 Confetti 和 When2Call 的音频转换版本上的 7 个全模态模型的广泛评估,我们的框架表明,性能强烈依赖于模型和任务:Gemini-3.1-Flash-Live 获得最高的 Confetti 分数 (70.4),而 GPT-Realtime-1.5 在 When2Call 上表现最好 (71.9)。在 Confetti 上,文本到语音的差距范围从 Qwen3-Omni 的 1.8 点到 GPT-Realtime-1.5 的 4.8 点。对失败案例的有针对性的分析表明,降级通常反映了对演讲中论点价值的误解。考虑到现实世界的部署场景,我们进一步报告纯文本结果、基于歧义的重新表述压力测试以及根据人类偏好进行验证的无参考 LLM 作为判断协议。值得注意的是,我们发现至少具有 8B 个参数的开源 Qwen3 判断与专有判断的一致性超过 80%,支持隐私保护评估。总体而言,我们的框架提供了可验证且可重复的第一阶段诊断,可以补充专门构建的音频语料库。