论文
VoxSafeBench:联合评估语音中的安全、公平与隐私
VoxSafeBench: Not Just What Is Said, but Who, How, and Where
摘要
随着语音语言模型 (SLM) 从个人设备过渡到共享的多用户环境,它们的响应必须考虑的不仅仅是单词本身。谁在说话、他们的声音如何以及对话发生的地点都可能将原本良性的请求变成不安全、不公平或侵犯隐私的请求。然而,现有的基准主要关注基本的音频理解,孤立地研究个体风险,或者将本质上有害的内容与只会因声学背景而变得有问题的内容混为一谈。我们推出了 VoxSafeBench,它是首批在安全、公平和隐私三个维度上联合评估 SLM 中社会一致性的基准之一。 VoxSafeBench 采用两层设计:第一层使用匹配的文本和音频输入评估以内容为中心的风险,而第二层则针对音频条件风险,其中转录内容是良性的,但适当的响应取决于说话者、副语言线索或周围环境。为了验证第 2 层,我们加入了中间感知探针,并确认前沿 SLM 可以成功检测到这些声音线索,但仍然无法对其采取适当的行动。在 22 个双语覆盖的任务中,我们发现,在文本上看似强大的保护措施在语音中往往会降低:对说话者和场景条件风险的安全意识下降,当人口差异通过声音传达时公平性受到侵蚀,当上下文提示通过声音到达时,隐私保护会动摇。总之,这些结果暴露了普遍存在的言语基础差距:当前的 SLM 经常识别文本中的相关社会规范,但当决定性提示必须以言语为基础时却无法应用它。代码和数据可公开获取:https://amphionteam.github.io/VoxSafeBench_demopage/