论文

语音 AI 客户服务中的审计偏见和安全

Auditing Bias and Safety in Voice AI Customer Care

模型评测评测方法与指标

摘要

语音人工智能系统越来越多地调解客户服务交互,其中呼叫者的演示提示(例如口音、情感、流畅性和紧迫性)与服务请求一起提供。现有的公平性和安全性评估涵盖语音识别差异、口语对话偏差和语音代理能力,但很少将客户服务语音代理视为有状态、多轮、工具介导的系统,在这种系统中,在最终拒绝发生之前,伤害可能会成为额外的负担。我们为此类系统制定了一个验证门控审计框架。该框架 (i) 将本机语音与语音、级联 ASR、语言模型、TTS 以及混合工具介导的架构分开; (ii) 在受控呼叫者呈现条件下使用匹配的服务事实; (iii) 在推理之前验证事实不变性、呈现线索、伪影和声学测量; (iv) 记录物质成果和服务负担的路径。我们为活跃的行业评估计划定义研究问题、方法、七个验证门、六个系列指标集和声明边界。我们通过退款争议审计实例的完全综合工作示例来说明该框架。生产系统结果不包含在本次发布中;公开报告受到验证协议的控制。