论文
共同进化的技能生成和政策优化
Co-Evolving Skill Generation and Policy Optimization
摘要
技能增强强化学习通过存储从过去的经验中获得的可重用的程序知识来改进语言代理。现有方法通常使用强语言模型来分析轨迹、生成技能并在在线训练期间更新可检索的技能库。然而,他们很少评估新生成的技能在存储和重用之前是否有用。我们发现这种假设是不可靠的:即使是由专有前沿 LLM 生成的技能也表现出高度混合的效用,其中许多技能几乎没有带来任何好处,甚至会降低性能。一旦这些技能进入技能库,其效果就很难识别,因为后续的采样轨迹反馈会被延迟,并且通常反映的是多种检索到的技能的综合效果,而不是任何单个技能的边际贡献。我们提出了一个用于预存储技能验证的在线强化学习框架。该框架估计候选技能是否提供了超出当前任务已检索技能的有用信息。它使用标准采样轨迹预算在相同的任务和检索上下文下形成两个匹配组:以当前检索的技能为条件的基础采样轨迹,以及以相同技能加上从基本轨迹导出的一项候选技能为条件的技能增强采样轨迹。这两组之间的奖励差距估计了候选技能的上下文相关边际效用,使框架能够提升有用的技能,同时过滤无效或有害的技能,而无需额外的轨迹采样开销。该框架进一步使用这种边际效用信号来训练策略本身作为技能生成器,减少对重复调用专有模型的依赖。随着策略的发展,学习到的技能生成可能性可作为检索时间重新排序和过时技能修剪的上下文相关分数。