论文

面向智能体强化学习的动态双粒度技能库

Dynamic Dual-Granularity Skill Bank for Agentic RL

上下文与知识模型训练智能体系统强化学习记忆Agent SkillsAgentic RLAgent记忆

摘要

代理强化学习(RL)可以从可重用的经验中受益匪浅,但现有的基于技能的方法主要提取轨迹级指导,并且通常缺乏维持不断发展的技能记忆的原则性机制。我们提出了 D2Skill,这是一个用于代理 RL 的动态双粒度技能库,它将可重用的经验组织成用于高级指导的任务技能和用于细粒度决策支持和错误纠正的步骤技能。 D2Skill 通过在同一策略下配对基线和技能注入部署来联合训练策略和技能库,利用它们的性能差距来得出用于技能更新和策略优化的事后效用信号。技能库完全根据培训时的经验构建,通过反思不断扩展,并通过实用感知检索和修剪进行维护。使用 Qwen2.5-7B-Instruct 和 Qwen3-4B-Instruct-2507 在 ALFWorld 和 WebShop 上进行的实验表明,与无技能基线相比,D2Skill 持续将成功率提高了 10-20 个百分点。进一步的消融和分析表明,双粒度技能建模和动态技能维护对于这些收益都至关重要,而学到的技能表现出更高的效用,可以跨评估设置转移,并且仅引入适度的培训开销。

面向智能体强化学习的动态双粒度技能库:论文配图
(a) D2Skill 框架(b) 主要结果(c) 成功率训练曲线(d) 技能库效用动态图1:D2Skill 概述。 (a) 具有检索、反射驱动生成和管理功能的动态双粒度技能库。 (b) ALFWorld 和 WebShop 的总体结果。 (c) D2Skill 技能组、配对基线组和 GRPO 的 ALFWorld 训练曲线。 (d) 有管理和无管理的技能库动态,以平均技能效用和检索统计数据显示。