论文
通过在on-policy蒸馏学习思维模式的优势
Learning from Think-Mode Advantage via On-Policy Distillation
摘要
显式中间推理为大语言模型(LLM)提供了更强大的问题解决模式。我们研究通过在on-policy蒸馏(OPD)来学习这种思维模式的优势。 OPD 保留学生生成的轨迹,并在学生访问的前缀处提供密集的标记级教师目标。在蒸馏过程中使用特权推理而不是学生推理。统一 ThinkOPD 是一种自然思维驱动的 OPD 基线,它使固定教师处于一个共享的思维轨迹上,并统一提炼每个兄弟学生的反应。尽管其前缀是on-policy上的,但跟踪不需要遵循与每个完整响应兼容的路线:即使响应达到相同的结果,相同的特权跟踪也可能导致不同的师生差异。我们用跟踪响应分歧(TRD)总结了这种交互,并引入了 ThinkOPD,它通过将群体相对奖励增益与基于 TRD 的兼容性代理相结合,在响应级别进行监督。最终响应权重在每个rollout组内标准化。在数学推理和代码生成方面,ThinkOPD 在相同模型设置和跨模型师生配对中都优于 Uniform ThinkOPD,并且在受控比较中超过了代表性原理和自蒸馏基线。受控干预表明,结果效益和基于 TRD 的代理在这种情况下提供了互补的路由信号。思考驱动的 OPD 提供了一个受控的环境,用于研究教师的优势如何随着学生的反应而转移。