论文

重新审视策略对抗性黑盒蒸馏:校准分组奖励几何以实现有效的优势构建

Revisiting On-policy Adversarial Black-Box Distillation: Calibrating Groupwise Reward Geometry for Effective Advantage Construction

摘要

黑盒蒸馏是一种实用途径,可将仅公开文本输出的 API 可访问大语言模型的功能转移到较小的学生模型中。最近的政策对抗方法(例如 GAD)通过在批评者和学生之间形成对抗循环来改进 SeqKD,其中批评者为基于 GRPO 的学生政策优化提供奖励,而不是学生的抽样响应。然而,GRPO 根据同一提示下学生样本的组内相对奖励来计算优势,而批评者的训练主要是为了区分教师反应和学生反应。这种目标不匹配可能会产生规模缩小或利润脆弱的奖励组,从而导致脆弱的分组优化信号。我们提出了分组奖励几何调节(GRGC),这是一个两阶段框架,通过在评论家训练和政策优化期间塑造学生方奖励群体来改善优势构建。为了改善批评者侧条件作用,高斯分组最优传输校准在训练期间对批评者进行正则化,通过将排序的即时奖励与以组为中心的高斯分位数相匹配,生成具有非折叠分布的奖励组并平滑排名差距。建立在这种条件奖励几何结构的基础上,政策方群体功率调制在将即时奖励群体转化为优势之前重塑了它们,保留了评论家诱导的排序,同时增加了与优化相关的边际可分离性。针对不同教师、学生模型系列和规模以及训练数据集的广泛实验证明了 GRGC 在分布内和分布外评估方面的有效性,同时与 GAD 相比,引入的开销可以忽略不计。该代码可在 https://github.com/2018cx/GRGC. 获取