论文

Agent记忆蒸馏:以分层教师记忆赋能小型LLM智能体

Agent Memory Distillation: Empowering Small LLM Agents with Hierarchical Teacher Memory

上下文与知识记忆Agent记忆

摘要

记忆系统在提升智能体性能方面已展现出潜力,但其对小语言模型的潜力大多尚未被开发,因为小模型难以自行生成足够的成功轨迹。我们提出Agent记忆蒸馏(AMD),一个免训练框架,通过分层记忆把大型教师智能体的结构化知识迁移给小学生智能体。AMD从成功的教师轨迹构建三种互补记忆:工作流(Workflow)记忆编码任务级策略,子任务(Subtask)记忆在中间粒度上提供具体行为示例,函数(Function)记忆捕获各函数的调用惯例与常见陷阱。工作流与子任务记忆在每个任务开始时主动注入,而函数记忆在工具调用出错时被动检索。我们在三个工具使用基准上评估AMD,使用四个学生模型(4B-8B参数)并以GPT-5-mini为教师,在AppWorld、BFCL V3与ToolSandbox上分别取得平均27.2、11.2与3.4个百分点的准确率提升,并持续超越现有基于记忆的基线。进一步分析表明,子任务记忆贡献了最大增益,教师效果同时取决于教师能力与学生兼容性,而4B规模的学生从AMD中获益最多。

Agent记忆蒸馏:以分层教师记忆赋能小型LLM智能体:论文配图
图1:AMD的动机、概念与结果。(A) 学生生成的记忆受限于较低的任务成功率。(B) 朴素的教师记忆迁移因能力差距而收益有限。(C) AMD迁移跨越任务、子任务和函数层级的分层记忆,使教师知识对小型学生模型可用。(D) AMD在三个基准上取得显著的准确率提升。