论文

τ-Elicitation:语音智能体的多轮实体信息采集基准

$τ$-Elicitation: Benchmarking multi-turn entity extraction in voice agents

模型评测基准与评测资源

摘要

语音智能体通常需要精确收集姓名、地址、标识符、日期和时间等信息,但端到端基准测试无法明确捕捉失败的环节。我们提出了τ-Elicitation,一个包含200个任务的语音基准测试,涵盖10类实体、可控难度、真实来电者特征和三种环境。文本智能体能通过所有任务,但四种语音配置的稳健精确成功率仅为0.14至0.41。智能体在处理困难和陌生实体时增加验证,有时也对错误捕获进行验证,但对表现最差的来电者声音的验证无提升;仅有24至37%的验证错误被修复。引入一个包含拼写、读回、修正和确认的辅助框架,使Pass³成功率提升14至31个百分点,但每通电话耗时增加21至28秒。真实场景中的拼写变体和重启对精确成功率无显著影响;发音错误会增加修复难度。这些结果表明,策略选择和成功恢复是语音实体精确采集中的核心瓶颈。

τ-Elicitation:语音智能体的多轮实体信息采集基准:论文配图
图1:τ-Elicitation从实体库中选取值,构建受控任务,并通过τ-Voice交互循环执行。Pass³要求在三种环境实现中全部成功,图中量表表示对智能体语音保真度的评判。