论文
SIRI:面向LLM智能体的具有内在技能的自内化强化学习
SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training
摘要
长期 LLM 代理可以从可重用技能中受益,但现有的基于技能的方法通常在训练期间依赖外部技能生成器或在推理时持续进行技能检索,从而增加了工程复杂性、上下文长度和部署延迟。我们提出了具有内在技能的自我内化强化学习(SIRI),这是一个三阶段框架,使代理能够在没有外部技能生成器或推理时间技能库的情况下发现、验证和内化技能。 SIRI 首先与 GiGPO 进行政策预热,以获取基本的交互能力并收集成功的无技能轨迹。然后,它执行自我技能挖掘,其中当前策略从其自身成功的普通部署中总结了紧凑技能,并通过配对的技能增强和无技能部署来验证它们。最后,SIRI 使用轨迹级效用和行动级优势,仅将有益的技能引导行动词元提炼为简单策略。据推断,代理仅以原始提示运行。在使用 Qwen2.5-7B-Instruct 的 ALFWorld 和 WebShop 上,SIRI 将 ALFWorld 上的 GiGPO 从 0.908 提高到 0.930,在 WebShop 上从 0.728 提高到 0.813,优于基于提示、基于 RL 和内存增强的基线。进一步分析表明,我们的自挖掘策略可以达到与闭源大模型蒸馏相当的性能。我们的代码可在 https://github.com/kirito618/SIRI 获取。
