论文

RubricHub:通过自动粗到细生成构建的全面且高区分度评分准则数据集

RubricHub: A Comprehensive and Highly Discriminative Rubric Dataset via Automated Coarse-to-Fine Generation

模型训练合成数据

摘要

具有可验证奖励的强化学习(RLVR)推动了数学等推理密集型领域的实质性进展。然而,由于缺乏基本事实,优化开放式生成仍然具有挑战性。虽然基于评分标准的评估提供了结构化的验证代理,但现有方法存在可扩展性瓶颈和粗略标准,导致监督天花板效应。为了解决这个问题,我们提出了一个自动化的从粗到细的红字生成框架。通过协同原则引导的综合、多模型聚合和难度演化,我们的方法产生了全面且具有高度辨别力的标准,能够捕捉微妙的细微差别。基于这个框架,我们引入了RubricHub,一个大规模($\sim$110k)和多领域的数据集。我们通过由基于 Rubric 的拒绝采样微调 (RuFT) 和强化学习 (RuRL) 组成的两阶段训练后管道验证其实用性。实验结果表明,RubricHub 实现了显着的性能提升:我们训练后的 Qwen3-14B 在 HealthBench (69.3) 上取得了最先进 (SOTA) 的结果,超越了 GPT-5 等专有前沿模型。代码和数据将很快发布。

RubricHub:通过自动粗到细生成构建的全面且高区分度评分准则数据集
图2:方法整体流程。(a) Coarse-to-Fine Rubric Generation(由粗到细的量规生成):通过基于响应与基于原则的策略合成候选,再经聚合与难度演化精炼为 RubricHub。(b) Utilization of Rubric in Post-Training(量规在后训练中的利用):量规应用于 RuFT(左)进行拒绝采样,并应用于 RuRL(右)为策略优化提供结构化奖励信号。