论文
CataOPD:大型语言模型推理的催化同策略蒸馏
CataOPD: Catalytic On-Policy Distillation for Large Language Model Reasoning
摘要
强化学习(RL)和同策略蒸馏(OPD)是改进大语言模型推理的两个代表性范式。然而,当没有采样到正确的轨迹时,RL 缺乏正的正确性信号,而 OPD 仍然受到学生当前策略分布下可达到的推理轨迹的限制。因此,我们提出 CataOPD,其中教师充当催化剂而不是目标,扩大可达性,同时将经过验证的学生生成的轨迹内化为无催化剂的策略。自救路由使用经验上全部失败的组作为路由信号而不是教师干预触发器,首先通过额外的策略自我采样来寻求正确的轨迹。对于自救后未解决的问题,催化引导自我解决利用催化引导在引导学生分布中引出经过验证的学生产生的轨迹。障碍加权内部化通过引导到非引导的对数概率差距来对词元进行加权,将更新集中在没有引导的情况下很难的决定性词元上。实验结果表明,CataOPD 的性能优于当前基线,将独立学生推理扩展到尚未恢复的问题,并提高了无催化剂推理下的分布外泛化能力。我们的项目可以通过此 https URL 获取。