论文
SpeechCritic:从有限人类偏好中学习诊断性语音评审器
SpeechCritic: Learning a Diagnostic Speech Judge from Limited Human Preferences
摘要
人类语音传达丰富的感知信息,例如情感和说话者身份,但大多数自动语音质量判断器会将其降低为单一的自然度分数。我们研究诊断性语音评审:给定两个候选语音,诊断评审决定哪一个更好,他们在哪些感知维度(例如音色、情感、时间)上存在差异,以及哪些听觉线索支持其决定。学习这样的判断是具有挑战性的:专家注释的成本很高,并且简单地提示前沿音频语言模型来生成标签是不可靠的:我们的探测揭示了严重的错误和不稳定的指令遵循。我们引入了 SpeechCritic,它仅通过大约 300 个人类标记的比较,在参考条件跨语言环境中学习诊断判断。 SpeechCritic 没有取代前沿模型,而是使用这些标签对其进行校准:对于每个维度,它选择与人类判断一致的声学测量,将它们映射到 A/Tie/B 概率,并将这些作为与音频一起的非约束性提示传递给模型。与没有提示的相同模型标签相比,这将与人类的维度水平一致性提高了 6.3 个百分点,并将与人类的 Tie 率不匹配降低了 10.4 个百分点。然后,我们在这种监督上训练 7B 评审,发现不同的训练信号塑造了不同的评审行为:SFT 建立任务,OPD 转移教师的维度水平优势和劣势,而 RL 在人类评分者同意的情况下进行清晰比较最有帮助。值得注意的是,人类听众还发现强化学习使理由引用更具体、局部可定位的声学线索,尽管它从不直接奖励理由文本。最后,我们通过在英语-日语和英语-西班牙语上实例化该管道,证明该管道与语言对无关。总之,这些结果展示了从有限的人类偏好到诊断性语音判断的路径。