论文

IHBench:使用结构化工作流程评估语音代理的中断后恢复

IHBench: Evaluating Post-Interruption Recovery in Voice Agents with Structured Workflows

模型评测基准与评测资源

摘要

部署在结构化工作流程(客户服务、医疗保健调度、帐户管理)中的语音代理必须处理频繁的用户中断,同时通过多步骤程序保持进度。语音模型的现有基准侧重于中断时间:插入检测、端点和轮流动态。他们没有衡量中断后发生的情况:代理是否在正确的步骤恢复工作流程?它是否解决了用户的感叹?它是否避免重新传递用户已经听过的内容?我们推出了 IHBench(中断处理基准),这是一个基准,用于评估跨 10 个企业域执行状态机驱动的工作流程的语音代理的中断后恢复。在话语中间的控制点注入六种中断类型,并与数据一起生成每次中断的评估规则。每次中断都会在两个轴上进行评分:任务完成度和恢复质量。我们评估了来自 OpenAI、Google 和开放权重社区的 27 种音频语言模型配置。模型差异很大,恢复质量很大程度上取决于中断类型。在我们的实验中,封闭权重模型始终比开放权重模型更能抵抗干扰:它们在任务完成方面获胜的几率要高得多,随着对话时间的延长,性能下降的速度大约是原来的 3.3 倍,并且没有显示音频与文本模态的差距,而开放权重模型在这三个方面都表现不佳。一项人类研究验证了 LLM 与人类注释者的判断,并且针对 AudioMultiChallenge 的交叉基准分析表明恢复质量是一个很大程度上不同的能力轴。