论文
检索增强的LLM智能体:学会从经验中学习
Retrieval-Augmented LLM Agents: Learning to Learn from Experience
摘要
虽然大语言模型(LLM)促进了通用代理的开发,但实现对未见过的任务的强大泛化仍然是一个重大挑战。当前的方法通常依赖于使用检索到的经验进行微调或无需训练的记忆增强生成;但两者都有局限性:微调通常无法推断到新任务,而经验检索与监督基线相比通常表现不佳。在这项工作中,我们建议结合这些方法,系统地研究如何训练检索增强的 LLM 代理,以有效地利用上下文中检索到的轨迹。首先,我们使用 LoRA 建立了一个强大的监督微调(SFT)配方,其性能优于几个最先进的代理训练管道。其次,我们对经验检索的关键设计选择进行了详细分析,确定了存储、查询和轨迹选择的最佳策略。最后,我们提出了一个将经验检索集成到微调过程中的管道。我们的结果表明,这种组合方法显着提高了对看不见的任务的泛化能力,为构建从经验中学习的代理提供了可扩展且有效的框架。
