论文

ARISE:分层强化学习中基于内在技能演化的智能体推理

ARISE: Agent Reasoning with Intrinsic Skill Evolution in Hierarchical Reinforcement Learning

模型训练上下文与知识智能体系统强化学习记忆Agent SkillsRLVRAgentic RLAgent记忆

摘要

提升语言模型数学推理能力的主流范式依赖于基于可验证奖励的强化学习。然而,现有方法将每个问题实例孤立处理,没有利用训练过程中涌现并积累的可复用策略。为此,我们提出ARISE(Agent Reasoning via Intrinsic Skill Evolution),一个分层强化学习框架,其中共享策略同时承担高层技能管理与低层回应生成(分别称为Skills Manager与Worker)。Manager通过专门的技能生成rollout维护分层技能库,对成功解题轨迹进行结构化总结(执行后),并采用策略驱动的选择机制检索相关技能以对未来rollout进行条件化(执行前)。分层奖励设计引导推理能力与技能库质量的共同演化。在两个基座模型和七个涵盖竞赛数学与Omni-MATH的基准上的实验表明,ARISE持续优于GRPO系列算法与记忆增强基线,在分布外任务上的提升尤为显著。消融研究证实每个组件都对所观察到的改进有贡献,且技能库质量与推理性能在整个训练过程中同步提升。代码发布于https://github.com/Skylanding/ARISE。

ARISE:分层强化学习中基于内在技能演化的智能体推理:论文配图
图 2:ARISE 概述。共享策略 πθ\pi_{\theta} 同时充当技能经理和工人。每次推出之前,管理器都会通过条件日志概率对缓存条目进行评分,并将所选技能注入提示中(下载)。奖励计算后,额外推出 OG+1O_{G+1} 将成功的解决方案提炼成结构化技能文档(上传)。两层库由一个紧凑的缓存(用于选择的活动池)和一个较大的存储库(用于将来升级的存档)组成,由五个操作维护:Add、Update、Evict、Load 和Delete。