论文
超越轨迹模仿:面向LLM推理的策略引导策略优化
Beyond Trajectory Imitation: Strategy-Guided Policy Optimization for LLM Reasoning
摘要
从强模型向弱模型蒸馏推理能力通常涉及模仿特定解轨迹——实际迁移的是答什么而非怎么推理。这种轨迹级模仿鼓励记忆实例特定步骤——而非习得可迁移的问题解决技能——限制了对新问题的泛化。我们提出策略引导策略优化(SGPO)——用可复用策略蒸馏取代实例级轨迹模仿。SGPO从强模型响应抽取结构化策略描述——并为每个问题构造自主与策略引导两种轨迹——使模型在有无策略引导下的行为可直接比较。框架随后回答两个关键问题。关于怎么蒸馏:token级前向KL目标选择性地把策略条件化诱发的分布偏移迁移进无引导策略——近端约束保证稳定性。关于何时蒸馏:自适应实例级加权在自主探索不足时加强引导——随模型自身能力增长而减弱。跨两模型家族四个数学基准的实验表明SGPO持续超越SFT、自策略RL与混合策略基线——在Qwen2.5-7B-Instruct上较最强基线平均提升2.2分。分析揭示前向KL目标提供天然选择性的蒸馏信号——优于直接轨迹模仿——且策略蒸馏与基座模型能力呈互补扩展。
