论文

程序记忆蒸馏:面向自改进语言模型的在线反思

Procedural Memory Distillation: Online Reflection for Self-Improving Language Models

模型训练强化学习奖励建模与过程监督RLVR

摘要

可验证奖励强化学习(RLVR)及近期SDPO等自蒸馏变体——以验证器评估每个rollout——并从该episode级信号更新策略。但rollout中更丰富的过程性信息很少被保留或复用。跨episode与epoch——模型在变化策略下反复遇到相关问题——产生episode局部更新无法捕获的跨episode信号:哪些策略持续通过验证、哪些失败模式持续存在、哪些模式反复出现。我们提出过程记忆蒸馏(PMD)——将这些跨episode信号转化为可复用的过程记忆——并在训练期间将其蒸馏到策略权重中。该记忆作为训练脚手架——被吸收进策略本身——在推理时产生无记忆的模型。PMD在三个抽象层级组织记忆:原始轨迹、自我反思的策略与教训——以及跨问题复现的更高层行为模式——全部从模型自身轨迹在线提取。记忆条件化的自教师借鉴积累的经验在学生自己的rollout上监督学生——使学生逐步将过程性知识内化到参数中。核心设计原则是共同演化:策略生成更新记忆的rollout——记忆塑造更新策略的监督。实证上——跨Qwen3-8B与OLMo3-Instruct-7B——PMD在SCIKNOWEVAL上较SDPO提升3.8-5.5%——在LIVECODEBENCH上提升7.9-13.6%。共同演化驱动这些增益:冻结记忆或策略任一方都在SCIKNOWEVAL各域上落后PMD超过10%。

程序记忆蒸馏:面向自改进语言模型的在线反思:论文配图
图 1:程序内存蒸馏 (PMD) 概述。 (1) 学生反复尝试并收到验证者反馈。 (2)自我反思,将成功和失败总结成在线记忆。 (3)教师以经验、洞察、行为的形式检索相关记忆,提供记忆条件监督。 (4) 该指导被提炼到下一个时期的更新学生中。底行显示了内存层次结构,从原始轨迹到日益抽象和可重用的程序知识。