论文
作为开放式生成的特权信息的标题
Rubrics as Privileged Information for Open-Ended Generation
摘要
同策略 self-蒸馏 (OPSD),其中单个模型在不同的上下文中充当学生和教师,在数学等可验证领域显示出前景,其中 真值 答案形式的硬特权信息 (PI) 在结构上限制了有效的延续。我们使用软 PI 的形式将 OPSD 扩展到开放式生成,以指导偏好的形式引导偏好,但承认许多有效的响应。评分细则已成为强化学习 (RL) 的标量奖励;我们表明,它们为 蒸馏 提供了比密集 PI 更丰富的信号,并且与直觉相反,在这种情况下,软标题 PI 比硬参考完成 PI 为学生推出提供了更大、更有效的训练信号。参考完成是一组有效答案中的一个点,因此对其进行提炼会过度限制学生,而评分细则指定了在一组有效答案中共享的偏好结构。我们展示了使用评分标准作为 Qwen 和 Llama 模型系列的开放式生成的 PI 的有效性,并表明它使用 HealthBench 优于评分标准作为奖励 (RaR) RL,HealthBench 是一个根据医生创建的评分标准对开放式健康反应进行评分的基准,为开放式任务提供密集的 词元级 监督; RuPI 以 +0.10 绝对分数击败 RaR RL,并且在匹配的配方和 KL 方向下,在三个模型中以 +0.034 至 +0.079 绝对分数击败参考 PI。我们进一步表明,这些发现可推广到 RubricHub Science 语料库的训练和 ResearchQA 的评估:soft rubric PI 优于参考 PI 蒸馏 和 RaR RL(66.6% vs. 64.2% 和 57.6%)。