论文
ARISE:适应 Agentic 强化学习中不断变化的能力差距
ARISE: Adapting to Evolving Capability Gaps in Agentic Reinforcement Learning
摘要
随着长时域智能体通过经验不断改进,以前观察到的弱点可能会消失,同时新的限制会出现,不断改变它仍然需要学习的内容。然而,学习过程通常仍然与这些需求的静态视图相关:固定的行为标准和训练优先级可能会与不断变化的Agent能力不一致,而稀疏的任务级反馈使这种不一致更难以检测。即使发现了能力差距,当前策略的rollout也可能会反复重现相同的失败,而不是探索更好的替代方案。为了解决这个问题,我们引入了自适应评分标准技能协同进化(ARISE),这是一种强化学习框架,它使用rollout证据来不断调整评估标准、探索指导和训练优先级。评分标准不断发展以奖励部分行为进步,而其配对技能则得到完善并有选择地激活,以引导对未解决的弱点的探索。除了这种共同进化之外,基于能力的自适应采样还会优先考虑针对需要进一步改进的行为的任务。在两个具有挑战性的长期Agent基准(SkillsBench 和 Terminal-Bench)上进行的实验表明,ARISE 成功提高了整体任务性能和训练效率。项目页面位于 https://foundation-model-research.github.io/ARISE 。