论文

近端策略优化区域:老师在提示中,而不是梯度中

Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients

模型训练强化学习

摘要

知识蒸馏 将教师的能力转移给小学生,但在小学生制度中很脆弱:强迫学生模仿大得多的教师的 logits 会损害训练语料库之外的基准家庭的泛化。强化学习 (RL) 通过对学生自己的采样轨迹进行训练来避免 logits 模仿。然而,对于每条采样轨迹都失败、产生零优势并被默默丢弃的问题,在策略梯度中注入更强的教师响应会打破 同策略 假设并引发漂移。受到维果茨基最近发展区的启发,我们引入了最近政策优化区(ZPPO)。 ZPPO 让教师处于提示范围内,而不是策略梯度范围内。对于难题,即学生的采样轨迹的平均正确率低于一半,ZPPO 构建了两个重新制定的提示。包含二元候选的问题 (BCQ) 将一个正确的教师回答与一个不正确的学生回答配对,作为学生用作参考的匿名候选。包含否定候选人的问题 (NCQ) 将学生的错误展示汇总到一个提示中,以揭示他们共同的失败模式。即时重放缓冲区使每个难题都有资格重新采样,直到它毕业,学生的采样轨迹平均正确率达到一半或以上,或者在有限容量下被 FIFO 驱逐,从而在学生当前的最近发展区域内放大 BCQ 和 NCQ。我们与 27B 教师一起对 Qwen3.5 学生进行四种尺度(0.8B-9B)的视觉语言模型后训练,并在 31 个基准套件(16 个 VLM、10 个 LLM、5 个视频)上对其进行评估; ZPPO 的表现优于 off/同策略 蒸馏 和 GRPO,以最小的规模获得最大的收益。