论文
PATS:面向智能体强化学习的策略感知训练脚手架
PATS: Policy-Aware Training Scaffolding for Agentic Reinforcement Learning
摘要
在长程LLM智能体强化学习中,弱策略常重复相似失败,产出无信息量的rollout轨迹并限制有效策略优化。既有技能中心方法经优化、过滤或内化可复用技能改进探索,但仍以技能本身为中心,而非作为面向演化策略的自适应训练时支持来设计。为此我们提出以策略为中心的训练范式:把技能重构为动态训练脚手架。我们的框架PATS把来自最新策略的rollout组转为证据卡,并用任务专属评估调整后续rollout使用的上下文:具体指导帮助弱策略完成困难任务;随着策略改进,冗余上下文被修订或移除,在保留有用rollout变化的同时降低对显式指导的依赖。策略以环境奖励经标准RLVR优化,训练脚手架在部署时丢弃。跨ALFWorld、WebShop与七个搜索增强QA基准,PATS以少25%–50%的token取得与SOTA基线有竞争力的表现。
