论文
程序记忆蒸馏:面向自改进语言模型的在线反思
Procedural Memory Distillation: Online Reflection for Self-Improving Language Models
摘要
可验证奖励强化学习(RLVR)及近期SDPO等自蒸馏变体——以验证器评估每个rollout——并从该episode级信号更新策略。但rollout中更丰富的过程性信息很少被保留或复用。跨episode与epoch——模型在变化策略下反复遇到相关问题——产生episode局部更新无法捕获的跨episode信号:哪些策略持续通过验证、哪些失败模式持续存在、哪些模式反复出现。我们提出过程记忆蒸馏(PMD)——将这些跨episode信号转化为可复用的过程记忆——并在训练期间将其蒸馏到策略权重中。该记忆作为训练脚手架——被吸收进策略本身——在推理时产生无记忆的模型。PMD在三个抽象层级组织记忆:原始轨迹、自我反思的策略与教训——以及跨问题复现的更高层行为模式——全部从模型自身轨迹在线提取。记忆条件化的自教师借鉴积累的经验在学生自己的rollout上监督学生——使学生逐步将过程性知识内化到参数中。核心设计原则是共同演化:策略生成更新记忆的rollout——记忆塑造更新策略的监督。实证上——跨Qwen3-8B与OLMo3-Instruct-7B——PMD在SCIKNOWEVAL上较SDPO提升3.8-5.5%——在LIVECODEBENCH上提升7.9-13.6%。共同演化驱动这些增益:冻结记忆或策略任一方都在SCIKNOWEVAL各域上落后PMD超过10%。
