论文

用评分标准思考:从外部评估到内部推理指导

Think-with-Rubrics: From External Evaluator to Internal Reasoning Guidance

模型训练监督微调与指令调优

摘要

评分标准已被广泛用于评估无法验证的开放式任务,最近的研究将其纳入强化学习的奖励系统中。然而,现有框架通常仅将评分标准视为与政策的主要推理轨迹脱节的外部评估者。这种设计将规则限制于事后测量,使它们无法主动指导模型的生成过程。在这项工作中,我们引入了 Think-with-Rubrics,这是一种用于指导任务的新颖范式。 Think-with-Rubrics 将评分标准生成集成到推理上下文中,将评分标准从独立的工件转变为 LLM 生成的内部指导。在训练过程中,LLM 依次生成一个评分标准,然后是一个响应,而经过训练的评分标准验证者通过评估答案与自行生成/黄金评分标准之间的一致性来提供联合监督。跨多个基准的实验表明,Think-with-Rubrics 始终优于由黄金评分标准监督的 Rubric-as-Reward 基线,平均高出 3.87 分。我们还讨论了 Think-with-Rubrics 增强模型性能的机制。实验结果表明,黄金量规和自生成量规的监督分别通过提高自生成量规的质量和增加响应的内部一致性来增强 Think-with-Rubrics 的性能。