论文
经参数记忆扩展自演化智能体
Scaling Self-Evolving Agents via Parametric Memory
摘要
现有的记忆增强大语言模型代理将过去的经验专门存储在提示空间中,作为文本摘要或检索的段落,同时在整个部署过程中保持模型参数冻结。这些代理可以\emph{查找}他们所看到的内容,但无法\emph{从中学习:他们的策略不会因经验而改变,并且从上下文中删除的任何信息都将永久丢失。我们引入了 \texttt{TMEM},一种自我进化的参数化记忆框架,其中代理不仅将历史压缩到显式记忆中,而且还通过轻量级在线更新将蒸馏监督吸收到快速 LoRA 权重 $Δ_t$ 中,真正改变其在单个情节中的未来行为。我们将其形式化为具有快速权重执行轨迹动态的代理决策过程:从 $π_{θ_0+Δ_t}$ 中采样动作,而提取动作产生监督,更新后续决策的 $Δ_t$。这种观点使得提取策略可以通过 RL 直接优化:训练 $θ_0$ 不仅提高了任务动作,还提高了用于在线 LoRA 适应的数据质量。我们进一步提出基于 SVD 的 LoRA 子空间初始化,以加速在线收敛。 LoCoMo、LongMemEval-S、多目标搜索和 CL-Bench 上的实验表明,\texttt{TMEM} 在不同模型规模上始终优于基于摘要和基于检索的基线。
