论文
几乎是人性的,除了重要的时候:VoxParity 和声音应该改变的决定
Almost Human, Except When It Matters: VoxParity and the Decisions a Voice Should Change
摘要
语音Agent可以仅凭语音处理几乎所有呼叫,但仍然无法满足其行业规则的要求。紧急呼叫标准、欺诈指南、无线电用语和漏洞规则认识到呼叫者的声音或其他可听到的声音可以改变正确的行动。 VoxParity 测试Agent是否对其采取行动。在来自 14 个部门的 183 个场景中,一份文字记录保持不变,而音频发生变化(教练声音、医疗监视器蜂鸣声、无线电检查下的求救声、药物名称的噪音、孩子下注的声音、受惊的耳语)以及正确键入的工具调用。仅当听到呼叫所移动的操作多于仅读取单词的管道时,仅单词空测试才对系统进行评分。 23 个系统中只有 11 个也可以在成绩单上运行通过。从描述性的角度来看,错误主要集中在文字方面:当音频请求保护时,所有 28 个系统执行例行请求的频率都高于对干净调用的过度反应(41% 对 12%;仅文字管道,58% 对 15%)。探索性分析将大多数领先系统的失误归咎于他们听到的线索;系统几乎完全在规定规则的项目上击败零;主导系统推翻的声音比强烈的警报更频繁地听到辞职或困惑;并且,在测试的模型中,描述声音和陈述规则都弥补了部分不足,留下了情感上的空白。