论文

SkillRise:跨任务技能进化的代理强化学习

SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution

模型训练强化学习

摘要

大语言模型 代理经常遇到相关但不同的任务,这些任务共享可重用的解决方案模式。然而,标准的代理强化学习将任务视为独立的事件,而现有的技能学习方法要么专注于一项任务的重复尝试,要么使用包含提取、检索和执行的多个阶段的管道。我们推出 SkillRise,这是一个统一的强化学习框架,用于跨任务学习技能。 SkillRise 将相关实例组织成逐渐具有挑战性的序列,并使用单一策略在任务解决和管理直接传递到下一个任务的不断发展的技能文档之间交替。跨任务的解耦信用分配可以监督当前任务结果的解决以及折扣下游结果的策划。 ALFWorld、WebShop 和 ScienceWorld 上的实验表明,SkillRise 在比较方法中实现了最强的 Pass@1 性能,较最强基线提高了 2.3 至 8.5 个百分点。尽管在不同的任务中进行了训练,但其学习的管理策略对于同一任务的重复尝试仍然有效。进一步的分析揭示了测试时跨任务的扩展:即使每个任务仅尝试一次,性能也会随着相关任务序列的延长而提高。这一趋势表明,SkillRise 重复使用跨任务的可转移技能,而不是从同一任务的重复采样中受益。 SkillRise 进一步保留了强大的性能,同时大幅减少了多阶段技能学习管道的运行时开销。总之,这些结果为 LLM 代理提供了一个简单而高效的训练范例,以提取、完善和重用跨任务的可转移技能。