论文

基于评分标准的 同策略 蒸馏

Rubric-based On-policy Distillation

摘要

同策略 蒸馏 (OPD) 是模型对齐的强大范例,但其对教师 logits 的依赖限制了其在白盒场景中的应用。我们认为,结构化语义量规可以作为教师 logits 的可扩展替代方案,使 OPD 仅使用教师生成的响应。为了证明这一点,我们引入了 ROPD,这是一个基于 rubric 的 OPD 的简单但基础的框架。具体来说,ROPD 从师生对比中归纳出特定于提示的评分标准,然后利用这些评分标准对学生的展示进行评分,以实现 同策略 优化。根据经验,ROPD 在大多数情况下都优于基于 logits 的先进 OPD 方法,并且样品效率提高了 10 倍。这些结果将基于标题的 OPD 定位为流行的基于 logits 的 OPD 的灵活、黑盒兼容的替代方案,为跨专有和开源 LLM 的可扩展 蒸馏 提供简单而强大的基线。代码可在 https://github.com/Peregrine123/ROPD_official 获取。