论文

MemoryWalker:停止在他们从未见过的环境中训练智能体

MemoryWalker: Stop Training Agents on Contexts They Never Saw

模型训练强化学习

摘要

Claude Code和Qwen-Agent等生产智能体运行框架在执行采样轨迹时压缩上下文,但每次移除上下文都会使有效历史分叉,训练对象因此是一棵树而非单一序列。现有线性化要么保留最右路径、泄露当时尚未出现的信息,要么回放深度优先遍历、造成训练与推理不一致。我们提出两种精确且梯度等价的修正:分段K次前向遍历的LogitTree,以及打包的四维注意力掩码。前者需K+1次反向传播,后者需自定义内核与白盒上下文移除记录。另提出SDCC,即维持条件一致性的自蒸馏,作为一次反向传播的变分松弛。在各次移除处,最小化压缩学生与基于重建移除前前缀、停止梯度的教师之间的前向KL。各分叉点残余KL为epsilon_KL时,训练与部署的总变差差距上界为O(sqrt(epsilon_KL))。SDCC也适用于黑盒运行框架。在使用TC-RAG、AgentFold、MemexRL、Claude Code和OpenCode的七项网页搜索基准上,朴素训练扩大训练与采样的对数概率差距,移除较多上下文时尤甚。精确方法保持无压缩基线水平,SDCC也显著缩小差距、降低logit漂移并提高采样奖励。