论文

评分标准到词元:在指令跟踪任务中桥接响应级别评分标准和 词元级 奖励

Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks

模型训练奖励建模与过程监督

摘要

基于 Rubric 的强化学习 (RL) 已成为一种很有前景的方法,可将 大语言模型 (LLM) 与复杂的开放域指令跟踪任务结合起来。然而,现有的方法主要依赖于响应级别的奖励,引入了严重的奖励稀疏性和奖励模糊性问题。为了解决这些问题,我们提出了 Rubrics to Tokens (RTT),这是一种基于 rubric 的新型 RL 框架,可以连接粗略的响应级别分数和细粒度的 词元级 奖励归因。 RTT 引入了 词元级 相关性鉴别器来预测响应中的哪些词元负责特定约束,并通过 RTT-GRPO 优化策略模型,将响应级别和 词元级 优势集成在统一框架内。此外,当在基于 词元级 rubric 的 RL 中从一维、结果级奖励过渡到三维奖励空间时,我们提出了一种新颖的组标准化方法,称为样本内词元组标准化,以适应这种转变。大量的实验和基准测试表明,RTT 在不同模型中的指令和标题级别准确性方面始终优于其他基线。