论文

检索增强的LLM智能体:学会从经验中学习

Retrieval-Augmented LLM Agents: Learning to Learn from Experience

模型训练上下文与知识监督微调与指令调优记忆Agent记忆

摘要

虽然大语言模型(LLM)促进了通用代理的开发,但实现对未见过的任务的强大泛化仍然是一个重大挑战。当前的方法通常依赖于使用检索到的经验进行微调或无需训练的记忆增强生成;但两者都有局限性:微调通常无法推断到新任务,而经验检索与监督基线相比通常表现不佳。在这项工作中,我们建议结合这些方法,系统地研究如何训练检索增强的 LLM 代理,以有效地利用上下文中检索到的轨迹。首先,我们使用 LoRA 建立了一个强大的监督微调(SFT)配方,其性能优于几个最先进的代理训练管道。其次,我们对经验检索的关键设计选择进行了详细分析,确定了存储、查询和轨迹选择的最佳策略。最后,我们提出了一个将经验检索集成到微调过程中的管道。我们的结果表明,这种组合方法显着提高了对看不见的任务的泛化能力,为构建从经验中学习的代理提供了可扩展且有效的框架。

检索增强的LLM智能体:学会从经验中学习:论文配图
(a) LoRA(无检索)、ind(b) ExpRAG-LoRA(匹配索引)、ind(c) LoRA(无检索)、ood(d) ExpRAG-LoRA(匹配索引)、ood 图 2:尽管验证损失不断增加,但较长时间的微调可以提高泛化能力。比较 ALFWorld 上训练周期数的验证损失和推理性能。蓝色:验证交叉熵(左轴;越低越好)。绿色/橙色:在 50 轮微调期间在多个检查点评估推出成功率和平均情节分数(右轴;越高越好)。顶部:easy→\rightarroweasy(分发中)。底部:简单→\rightarrowhard(分布外)。对于 ExpRAG-LoRA,检索对每个评估分割使用匹配的索引。