论文

MetaRubric:为量规RL学习奖励

MetaRubric: Learning to Reward for Rubric-Based Reinforcement Learning

模型训练奖励建模与过程监督

摘要

基于量规的强化学习通过对单个响应要求赋予部分得分,把奖励驱动优化扩展到开放式任务。但量规裁判可能在响应缺少所需信息或动作时仍给高分——我们把这一失败模式称为空洞信用(Vacuous Credit)。此类得分在所需信息被移除后仍持续,并可逆转响应GRPO优势的符号。为此我们提出MetaRubric:交替进行证据感知策略优化与响应引导的量规适配。我们通过改变每个提示中一个任务相关事实构造反事实对应物;策略优化期间,只有响应包含足够证据满足所需量规标准时才授予信用;每个策略优化阶段后,用当前策略响应引导对原始与反事实标准的修订,同时保持原提示初始量规在各提示事实下解释的含义;并在阶段边界适配标准权重以更好处理观察到的策略错误。跨多个骨干,MetaRubric较静态裁判GRPO将PubMedQA准确率提升6.00-20.40个百分点,在HealthBench-Hard与两个多模态医疗基准上进一步增益。