论文

MTVA-Bench:单独评测级联语音Agent中的语言模型

MTVA-Bench: Evaluating the Language Model Inside Cascaded Voice Agents

智能体系统Agent任务评测

摘要

多数语音智能体采用级联系统:ASR将来电音频转写,语言模型读取转写并决定说什么、调用哪些后端工具,TTS再播报回复。几乎全部决策发生在语言模型中,但现有评价要么过宽、要么过窄。端到端语音基准评价整条链路,把识别和模型错误混成一个数字;LLM基准虽隔离模型,却不评价真实通话的难点,如转写问题、来电者语音被拆成多条消息,以及回复遵循指定语言与文字系统的要求。我们提出多轮语音智能体基准MTVA-Bench,在模型于级联系统中实际面对的条件下进行评价。来电者由遵循一组评分规则的LLM扮演,工具调用由根据模型实际发送参数作出响应的模拟后端回答。基准包含49个智能体、490个经审查场景,支持7种语言。评分结合工具调用的确定性检查与两名LLM评审:一名评价场景专属规则,一名在不知道任务的情况下评价对话质量;两者都必须引用转写中的具体消息。任务和对话得分等权,因为通话可能完成任务却仍让来电者体验不佳。在七模型研究中,六个模型正确选工具的得分相差不超过6.4分,但总体得分跨度达24.4分;大部分差距来自参数值、动作顺序、规则遵循,以及模型在工具调用前后说了什么。