论文

Inquesto Score:面向完整语音智能体的可靠性协议

Inquesto Score: A reliability Protocol For Voice Agents

智能体系统Agent任务评测

摘要

语音代理越来越多地部署在工作流程中,其中失败的交互可能会影响事务、访问和其他后果结果,从而需要可重复和可解释的评估。我们引入了 Inquesto Score (IS),这是一种用于衡量语音代理可靠性的协议,即在固定的、版本化的评估群体中实现呼叫者目标而没有出现功能故障或更糟情况的呼叫百分比。 IS 不是组合异构指标,而是定义明确的故障事件和严重性级别并评估已部署的语音管道。计时故障(包括抢话和延迟响应)是直接从音频中测量的,而语义和状态相关的故障则使用场景谓词、工具跟踪和固定的开放模型判断来评估。行为、声学鲁棒性、身份处理和说话者群体的诊断视图伴随着分数,但没有合并到其中。 Inquesto Score v0.1 评估参考语音代理系统的 13 种配置中的 30 个场景、三种声学条件、四个说话者组以及每个代理的 306 个呼叫。我们的评估表明,可靠的测量需要超越记录的证据、对部署条件的明确处理以及对用于确定结果的评估者的验证。我们发布协议、参考实现和评估记录。