论文
UniRRM:跨语言和评估范式的统一推理奖励模型
UniRRM: Unified Reasoning Reward Models Across Languages and Evaluation Paradigms
摘要
强化学习(RL)在具有可验证奖励的任务上表现出色,但在开放式任务中,奖励模型的可靠性仍然是一个关键挑战。现有的解决方案要么依赖于昂贵的专有 LLM-as-a-Judge 系统,要么依赖于缺乏可解释性的不透明标量奖励模型。最近关于生成奖励模型的研究提供了一个有前途的替代方案,但它们仍然受到静态评估标准、分散的评估范式和有限的多语言支持的限制。为了应对这些挑战,我们引入了 \textbf{MixReward},一个跨越 6 个领域和 103 种语言的大规模多语言数据集,包含成对和列表数据,并提出 \textbf{UniRRM},一个支持多种语言和评估范式的统一推理奖励模型。 UniRRM 使用分阶段推理链来动态生成通用任务和特定于指令的标准,从而实现细粒度、输入自适应判断,同时保持跨语言的一致性。实验表明,UniRRM-8B 和 UniRRM-14B 在多个基准中实现了接近同等大小模型的最先进性能,并且对于未见过的评估范例非常有效。此外,消融研究验证了 UniRRM 的可靠性和有效性。