论文

内部化温度:同策略 Self-蒸馏 作为强化学习的策略再加热器

Internalize the Temperature: On-Policy Self-Distillation as Policy Reheater for Reinforcement Learning

摘要

来自可验证奖励的强化学习提高了 大语言模型 的推理能力,但经常遭受熵崩溃,其中日益集中的策略减少了轨迹采样多样性和有用的学习信号。现有的补救措施要么限制强化学习目标(例如熵正则化),要么在轨迹采样收集期间调整采样温度,但这些干预措施仍然位于模型参数之外。我们提出了Temperature-Scaled 同策略 Self-蒸馏 (TS-OPSD),这是一种轻量级策略再加热方法,它将温度的探索性影响内化到模型参数中。从熵崩溃的 RL 检查点开始,TS-OPSD 通过将高温缩放应用于模型自己的 logits 来构建自教师,然后将所得的更平滑的分布提炼回学生。这种策略重新加热不需要外部教师、特权数据或额外的推理成本。 Qwen3-4B-Base 和 Qwen3-8B-Base 上的实验表明,与标准持续 RL 和轨迹采样级别温度再加热相比,策略再加热可以为持续 RL 产生更强的初始化。进一步的分析表明,TS-OPSD 主要降低输出清晰度,同时保留中间表示、顶级候选集和推理能力。这些结果表明熵恢复可以作为一种简单的崩溃后干预来扩展面向推理的强化学习。