论文
ARISE:分层强化学习中基于内在技能演化的智能体推理
ARISE: Agent Reasoning with Intrinsic Skill Evolution in Hierarchical Reinforcement Learning
摘要
提升语言模型数学推理能力的主流范式依赖于基于可验证奖励的强化学习。然而,现有方法将每个问题实例孤立处理,没有利用训练过程中涌现并积累的可复用策略。为此,我们提出ARISE(Agent Reasoning via Intrinsic Skill Evolution),一个分层强化学习框架,其中共享策略同时承担高层技能管理与低层回应生成(分别称为Skills Manager与Worker)。Manager通过专门的技能生成rollout维护分层技能库,对成功解题轨迹进行结构化总结(执行后),并采用策略驱动的选择机制检索相关技能以对未来rollout进行条件化(执行前)。分层奖励设计引导推理能力与技能库质量的共同演化。在两个基座模型和七个涵盖竞赛数学与Omni-MATH的基准上的实验表明,ARISE持续优于GRPO系列算法与记忆增强基线,在分布外任务上的提升尤为显著。消融研究证实每个组件都对所观察到的改进有贡献,且技能库质量与推理性能在整个训练过程中同步提升。代码发布于https://github.com/Skylanding/ARISE。
