论文

无需训练的指令TTS性别偏置校准

Training-Free Instruction TTS Gender Bias Calibration Using Model-Adaptive Steering

模型评测模型推理应用与实践推理验证与自校正鲁棒性、公平性与可信度评测语音交互与综合语音服务

摘要

指令文本到语音 (ITTS) 系统系统地编码来自描述性风格提示的声音性别偏差,例如职业或人物角色,即使人口统计属性未指定。在异构架构中校准合成声音的隐式性别分布,并且无需模型重新训练或覆盖显式用户提示,是一个悬而未决的问题。在这项工作中,我们提出了 \textit{模型自适应转向},这是一种无需训练的偏差校准方法,该方法使用与开发集上从粗到细的强度搜索配对的组偏差向量来引导编码器后调节表示。每当检测到明确的性别关键字时,确定性词汇门都会绕过干预,从而保留预期的提示语义。在四个 ITTS 模型(三种架构)的 12,800 个提示保持基准上进行评估,所提出的方法将聚合校准误差从 11.5--28.1 减少到 0.8--5.9 个百分点(例如,将 Parler-TTS Mini 从 78.1% 转变为 PromptTTS++ 从 27.3% 女性转变为 50.8--52.4%)。产出率保持不变 在固定操作点下,锚定集大小的误差在 0.9 pp 以内,而 UTMOS 最多下降 0.08,WER 最多下降 3.3 pp。