论文

声音还是刻板印象?理清语音到语音模型中的声学和基于内容的性别

Voice or Stereotype? Disentangling Acoustic and Content-Based Gender in Speech-to-Speech Models

模型评测鲁棒性、公平性与可信度评测

摘要

语音到语音 (S2S) 模型现在在配音、翻译和语音代理内部运行。与文本模型不同,它们听到说话者的声音,其中包含说话者的性别。一个忠实的系统应该按照说话者听起来的样子来对待,而不是按照通常所说的人来对待。测试这一点比看起来更难,因为大多数 S2S 模型都以单一的、固定的输出声音进行回答,并且是硬编码的,因此它不会偏离刻板印象。即使模型存在偏差,检查输出语音也会恢复干净。因此我们问两个问题。当模型重新说出输入时,单词中的刻板印象是否会改变输出语音(语音渲染)的感知性别?当模型陈述说话者的性别时,它是遵循声音还是内容(性别归因)?我们通过一项对照实验来回答这两个问题,该实验将男性和女性的声音与男性、中性和女性刻板的段落交叉,在英语、西班牙语和普通话的五个开源和闭源模型上进行。渲染的声音没有表现出刻板印象的漂移。但每个模型都是根据内容而不是声音来决定说话者的性别。让内容更加女性化(男性 -> 中性 -> 女性化)会使“女性”判断的几率增加 1.7-24。当内容与声音发生冲突时,最糟糕的模型在 90% 的情况下都会错误地判断说话者的性别。当他们同意时,性别错误的比例只有 2%。因此,偏见隐藏在性别归因中,固定声音评估无法看到这一点,审计必须关注其中,因为 S2S 系统越来越多地为真实的人说话。