论文

面向逐步模型路由的评分准则引导过程奖励

Rubric-Guided Process Reward for Stepwise Model Routing

模型训练奖励建模与过程监督

摘要

逐步模型路由通过将每个推理步骤分配给合适的模型来提升大型推理模型(Large Reasoning Model,LRM)的效率。近期方法将路由建模为序贯决策过程,并用强化学习训练路由器。然而,尽管这些方法把路由建模为过程,它们仍用结果奖励来监督路由器。这类奖励只反映最终答案的正确性,无法评估中间路由决策,可能削弱性能与泛化能力。为弥补这一缺口,我们提出RoRo,一个面向逐步模型路由的评分准则(rubric)引导过程奖励框架。RoRo首先收集多样的路由轨迹,并基于结果、成本与过程质量构建偏好对。随后通过交替优化,训练一个Rubricor生成针对查询的评估准则,以及一个Judge在该准则下为路由轨迹打分。所得过程奖励与结果奖励相结合,通过GRPO优化路由策略。在同族与跨族两种设定下五个推理基准上的实验表明,RoRo持续优于强基线,并取得更好的准确率与成本权衡。

面向逐步模型路由的评分准则引导过程奖励:论文配图
图 3:滚装管道概览。第 1 阶段根据路由策略构建路由偏好数据。第 2 阶段通过交替优化和验证门控来训练 Rubricor 和 Judge。第 3 阶段冻结两个组件并使用 GRPO 优化路由策略; Rubricor 生成特定于查询的评分标准。