论文

PATS:面向智能体强化学习的策略感知训练脚手架

PATS: Policy-Aware Training Scaffolding for Agentic Reinforcement Learning

模型训练智能体系统强化学习Agent SkillsRLVRAgentic RL

摘要

在长程LLM智能体强化学习中,弱策略常重复相似失败,产出无信息量的rollout轨迹并限制有效策略优化。既有技能中心方法经优化、过滤或内化可复用技能改进探索,但仍以技能本身为中心,而非作为面向演化策略的自适应训练时支持来设计。为此我们提出以策略为中心的训练范式:把技能重构为动态训练脚手架。我们的框架PATS把来自最新策略的rollout组转为证据卡,并用任务专属评估调整后续rollout使用的上下文:具体指导帮助弱策略完成困难任务;随着策略改进,冗余上下文被修订或移除,在保留有用rollout变化的同时降低对显式指导的依赖。策略以环境奖励经标准RLVR优化,训练脚手架在部署时丢弃。跨ALFWorld、WebShop与七个搜索增强QA基准,PATS以少25%–50%的token取得与SOTA基线有竞争力的表现。

PATS:面向智能体强化学习的策略感知训练脚手架:论文配图
图 2:不同训练方法的比较。左图:技能扩展方法保留了越来越多的经验,而技能删除方法则减少了内化任务能力的技能数量。 Pats 通过扩展、语义修改、压缩和有界修剪来动态调整技能。右图:数据驱动的课程会改变任务难度,而 Pats 则使数据集不受控制,仅使用训练支架调节临时技能。