论文
信任区域策略 蒸馏
Trust Region Policy Distillation
摘要
大目标很难一下子实现;将它们分成小步骤是更明智的做法。我们提出了信任区域策略 蒸馏 (TOP-D),它通过动态构建近端教师,将众所周知的不稳定、高方差 同策略 蒸馏 (OPD) 转变为稳定的训练范式。理论上,我们建立了一个严格的框架,证明 TOP-D 本质上控制着梯度方差。通过提供正式的全局收敛分析以及单调改进界限,我们在数学上形式化了整体训练动态的可靠性和稳定性。根据经验,TOP-D 极大地提高了数学推理任务的训练稳定性、样本效率和最终性能。更重要的是,TOP-D 引入了零额外计算开销,将其自身定位为成熟 OPD 范式的有前途的替代方案。