论文

ARISE-RL:通过强化学习实现智能体评分准则驱动的迭代自我演化

ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning

模型训练上下文与知识强化学习记忆Agentic RLAgent记忆

摘要

由于缺乏可验证的黄金答案和可扩展的标准,通过强化学习(RL)训练开放式智能体受到阻碍。此外,即使在模型的能力边界附近,长期开放式代理任务通常也会产生脆弱且不稳定的奖励,导致推出对比弱或嘈杂,从而模糊了基于组的策略学习的细粒度优化信号。为了应对这些挑战,我们提出了 ARISE-RL,这是一种新颖的全周期自进化框架,它通过标题介导的共同进化将任务/标题生成器和推理求解器耦合起来。生成器将与工具相关的标准标准建立在真实工具观察中,并因生成与求解器不断发展的能力边界一致的有效、中等难度的任务而获得奖励。反过来,求解器通过多步骤推理和工具使用从细粒度的满意度信号中学习。我们进一步引入了奖励门控自进化蒸馏(RG-SED),只有当记忆产生经验奖励改进时,它才选择性地将同一策略的记忆增强变体蒸馏回自身,从而减少分布失配并避免盲目模仿噪声指导。最后,为了支持严格的评估,我们推出了 ECR-Bench,这是一个经过专家校准的评估标准基准套件,涵盖单工具深度研究和多工具旅行规划。大量实验表明,ARISE-RL 在所有评估的基准测试中始终如一地实现了稳健的整体最先进性能。

ARISE-RL:通过强化学习实现智能体评分准则驱动的迭代自我演化:论文配图
图1:ARISE-RL的动力现有的远程开放式智能体培训受到很少的高质量查询和专家评分的限制,而且由于微弱的推出反差和限制政策改进而带来微弱和吵闹的奖励。ARISE-RL引入了一个以标注为媒介的自我革命循环,在循环中,生成器在溶剂能力边界附近生成基于工具的查询和标注,而溶剂则通过精细标记奖励和奖励制导来改进。这种设计减少了对人的监督,扩大了能力。