论文

UniSRM:基于推理的细粒度评估的统一语音奖励模型

UniSRM: A Unified Speech Reward Model for Reasoning-Based Fine-grained Assessment

模型训练奖励建模与过程监督

摘要

评估语音生成仍然严重依赖于人类判断,例如平均意见得分(MOS),其成本昂贵、主观且难以大规模重现。虽然最近的一些研究已经开始探索基于 AudioLLM 的判断模型,但现有的工作通常仅针对一组狭窄的场景(例如,话语级质量或单轮对话),并且对不同语音生成任务和评估维度的覆盖范围有限。在这项工作中,我们提出了 UniSRM,一种统一的语音奖励模型,可以通过可靠的推理支持多维、可解释的奖励信号。为了支持训练和评估,我们引入了 UniSRM-Data 和 UniSRM-Bench,涵盖从话语级质量到上下文级连贯性的语音评估任务。基于该数据集,我们提出了统一的语音奖励模型 UniSRM,该模型具有两阶段管道,可实现基于推理的细粒度评估。此外,我们引入推理一致奖励来提高推理过程的可靠性。实验表明,UniSRM 在广泛的语音评估任务中提供了更可靠、更人性化的判断,为可扩展和统一的语音质量评估提供了实用基础。