论文

超越轨迹模仿:面向LLM推理的策略引导策略优化

Beyond Trajectory Imitation: Strategy-Guided Policy Optimization for LLM Reasoning

摘要

从强模型向弱模型蒸馏推理能力通常涉及模仿特定解轨迹——实际迁移的是答什么而非怎么推理。这种轨迹级模仿鼓励记忆实例特定步骤——而非习得可迁移的问题解决技能——限制了对新问题的泛化。我们提出策略引导策略优化(SGPO)——用可复用策略蒸馏取代实例级轨迹模仿。SGPO从强模型响应抽取结构化策略描述——并为每个问题构造自主与策略引导两种轨迹——使模型在有无策略引导下的行为可直接比较。框架随后回答两个关键问题。关于怎么蒸馏:token级前向KL目标选择性地把策略条件化诱发的分布偏移迁移进无引导策略——近端约束保证稳定性。关于何时蒸馏:自适应实例级加权在自主探索不足时加强引导——随模型自身能力增长而减弱。跨两模型家族四个数学基准的实验表明SGPO持续超越SFT、自策略RL与混合策略基线——在Qwen2.5-7B-Instruct上较最强基线平均提升2.2分。分析揭示前向KL目标提供天然选择性的蒸馏信号——优于直接轨迹模仿——且策略蒸馏与基座模型能力呈互补扩展。

超越轨迹模仿:面向LLM推理的策略引导策略优化:论文配图
图 5:训练示例的步骤级 KL 分析。灰条:直接 SFT 损失,单调下降。彩色条:前向 KL 信号,在策略关键步骤处达到峰值(红色,例如确定 LCD、隔离变量),在常规步骤处达到最小值(蓝色)。