论文

ComplexConstraints及更多:面向RLVR的专家量规

ComplexConstraints and Beyond: Expert Rubrics for RLVR

模型训练奖励建模与过程监督

摘要

评估协议可能落后于大语言模型的能力。以编程方式验证的基准涵盖了狭窄的表面约束,而现实世界的指令遵循和代理工作流程需要判断语义、上下文和策略相关的行为。我们研究专家策划的基于评分标准的评估,作为跨两种环境的测量和强化学习奖励的统一机制:复杂的指令遵循和企业代理任务。我们确定了影响奖励质量的标准设计选择,包括最大可行原子性、意图感知标准设计和大语言模型法官校准。我们推出了 ComplexConstraints,这是一个专家策划的指令跟踪套件,包括一个包含 1,559 个标题标准的公共 75 个提示基准和一个不相交的 1,000 个提示训练集,每个提示有 10-40 个原子标准。根据经验,标题奖励可以改善固定任务数据集(例如 ComplexConstraints)和有状态 RL 环境(例如 CoreCraft)中的训练。在 ComplexConstraints 上训练 4B 模型在保留分割上将平均标准通过率提高了 +15.5 pp,使其与大约 60 倍大的 Qwen3 模型的未训练基线的 0.5 pp 之内,并且增益转移到模型在训练期间从未见过的外部基准:AdvancedIF 上 +8.4 pp 和 MultiChallenge 上 +10.1 pp。在 CoreCraft 中,rubric-reward RL 同样转移到分布外基准(+4.5 pp BFCL、+7.4 pp tau^2-Bench、+6.8 pp Toolathlon)。这些结果表明,专家撰写的评分标准为改善 LLM 指令遵循和代理行为提供了有效的评估目标和可扩展的奖励信号。