论文
持久负样本:稳定黑盒对抗在策略蒸馏
Persistent Negatives for Adversarial Black-Box On-Policy Distillation
摘要
在教师只提供采样响应而不提供token概率时,黑盒同策略蒸馏试图利用学生自身生成的内容改进学生。对抗蒸馏可通过同提示下教师与学生的响应训练判别器,并把评分作为策略奖励。但每步都从最新学生采样负例,会让奖励依赖于随策略更新不断变化的负例分布。持久负样本对抗蒸馏以动态样本池替换每个判别器批次中的一部分数据,使用历史上同提示的师生比较。在判别器计算量相同的条件下,历史比较用于训练判别器,GRPO仍以学生最新响应作同策略学习。理论把贝叶斯最优奖励表示为教师分布相对负例分布的对数密度比,并在明确假设下说明持久负样本如何稳定判别器、降低相对新鲜负样本训练的奖励估计均方误差。在两个学生家族、三个裁判及四个聊天评测基准上,方法在匹配判别器计算量时持续优于现有方法;新策略下的判别器轨迹更平滑,低于随机水平的下跌更少。研究表明,判别器负例分布是黑盒同策略蒸馏的重要设计因素。
