论文

AgentBrew:从强教师到弱LLM智能体的终身知识酿造

AgentBrew: Lifelong Knowledge Brewing from Strong Teachers to Weak LLM Agents

上下文与知识记忆Agent记忆

摘要

部署LLM智能体通常需要一个紧凑的测试时学生模型,即便训练时有更强的教师可用。我们研究知识酿造:把教师的交互经验蒸馏为学生的持久外部记忆。关键在于,这不需要权重更新、专家示范、真值标签或测试时的教师接入。该设定带来两个挑战:环境只提供稀疏的二元反馈;教师撰写的笔记必须天然 tailored 到能被显著更弱的学生具体执行。为克服这些障碍,我们提出AgentBrew,包含两个耦合组件。第一,失败触发的教师—Ralph循环:把学生失败转化为经环境验证的笔记,缓解稀疏反馈问题。第二,学生感知合成:把教师知识校准到弱执行者的操作粒度,产出模型特定、可执行的指导。在编程、数学与工具使用任务上的大量评估与全面消融表明,这种非对称、免训练的酿造范式能产出能力强且可部署的LLM智能体。

AgentBrew:从强教师到弱LLM智能体的终身知识酿造:论文配图
图 2:所提议的 AgentBrew 的总体框架。