论文
弱批评者成就强学习者:面向可扩展监督的同策略批评蒸馏
Weak Critics Make Strong Learners: On-Policy Critique Distillation for Scalable Oversight
摘要
随着大语言模型变得更强,弱监督者可能无法为复杂输出提供可靠的标签、偏好或最终判断,这同时限制了弱到强泛化与可扩展监督。我们研究一种更可行的弱监督形式:将弱模型用作批评者而非标注者或评判者。弱批评者无需完成任务或选出正确答案,只需提供无误导性的修改方向,帮助强模型更好地利用自身知识。我们将这一设定称为“弱批评者-强监督”。我们首先表明弱批评可以在推理时改进冻结的强模型,且批评质量是这一改进的关键。随后我们提出渐进式同策略批评蒸馏(OPCD),它过滤高质量批评,并通过自适应自教师信号将批评引导的行为蒸馏进强模型。在推理与对齐基准上的实验表明,我们的方法随训练轮次持续改进强模型,为弱监督下的可扩展监督提供了一条有效路径。