论文
自蒸馏政策梯度
Self-Distilled Policy Gradient
摘要
同策略 self-蒸馏,其中语言模型以特权上下文为条件来监督其自己的一代,是稀疏奖励强化学习的密集监督的有前途的来源。实际上,它可以被实例化为辅助全词汇量学生到教师的反向 Kullback-Leibler 散度损失。因此,我们提出了 SDPG,一种自蒸馏策略梯度框架,它将群体相对验证者优势与归一化标准差、精确全词汇 同策略 self-蒸馏 以及参考策略 KL 正则化结合起来。根据经验,SDPG 比 RLVR 和自我 蒸馏 基线提高了稳定性和性能。代码可在 https://github.com/lauyikfung/SDPG 获取。