论文

基于预测器的强化学习何时与人类感知一致?基于编解码器的语音语言模型中的主观奖励研究

When Does Predictor-Based RL Align with Human Perception? A Study of Subjective Rewards in Codec-Based Speech Language Models

模型评测鲁棒性、公平性与可信度评测

摘要

基于编解码器的文本转语音 (TTS) 模型使语言模型 后训练 适用于语音生成,但目前尚不清楚学习的感知预测器何时可以充当强化学习奖励而不与人类听众失去一致性。我们通过组相对策略优化(GRPO)来研究这个问题,使用学习到的奖励来评价动漫般的说话风格、自然度、可爱度和唤醒度。为了防止通过转录漂移来优化感知奖励,我们引入了字符错误率(CER)区域约束,并将策略优化与同一奖励门下的 Best-of-$N$ 重新排名进行比较。在单一奖励运行中,每个奖励主要改善其自身的目标指标,这表明主观预测因子​​不是可互换的质量替代品。多评估者 A/B 测试进一步显示了不均匀的人员转移,而奖励差距分析将平均转移与轴内校准分开:带符号的奖励差距可以显着预测汇总分析中的听众选择,而残余 CER 差距则不能,但每轴校准仍然是异构的。 Best-of-8 是一个强大的人类水平基线,并且在感知上并不明显比 GRPO 差,这表明 GRPO 应该被视为将奖励选择的行为摊销到政策中,而不是一致优于重新排名。这些结果支持将主观语音奖励分析为预测轴基元组,并为在多奖励语音 后训练 之前选择奖励提供实用的诊断。