论文

SeOPD:通过on-policy自蒸馏内化自生成思维链

SeOPD: Self-Evolving LLMs via Online Policy Distillation from Self-Generated Chain-of-Thought

摘要

在线策略自蒸馏(OPSD)的最新进展表明,大语言模型(LLM)可以通过利用外部特权信息(PI)(例如手动注释或来自外部环境的反馈)来提高其能力。然而,获得准确的注释和构建复杂的环境通常需要大量的人力和计算,限制了 OPSD 的可扩展性。虽然最近的一些研究探索了在没有外部 PI 的情况下的自我完善,但所得的收益仍然有限。在这项工作中,我们探讨了LLM是否可以在没有外部 PI 的情况下实现类似的自我改进。我们的主要观察是,单个LLM可以支持多种推理模式,例如深度思维和非思维模式,深度思维在推理过程中会产生额外的信息。基于这一观察,我们提出了自我进化在线策略蒸馏(SeOPD),它使LLM能够蒸馏和内化由自己的思维链(CoT)生成的信息。具体来说,它(1)用深度思维模式生成CoT,(2)用非思维模式产生响应,(3)使用生成的CoT作为PI为非思维响应提供词元级监督,让推理过程中推断出的新信息引导非思维模式并内化到共享模型参数中,从而提高非思维和深度思维能力。跨LLM和任务的广泛实验证明了 SeOPD 的有效性。