论文
ARISE-RL:通过强化学习实现智能体评分准则驱动的迭代自我演化
ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning
摘要
由于缺乏可验证的黄金答案和可扩展的标准,通过强化学习(RL)训练开放式智能体受到阻碍。此外,即使在模型的能力边界附近,长期开放式代理任务通常也会产生脆弱且不稳定的奖励,导致推出对比弱或嘈杂,从而模糊了基于组的策略学习的细粒度优化信号。为了应对这些挑战,我们提出了 ARISE-RL,这是一种新颖的全周期自进化框架,它通过标题介导的共同进化将任务/标题生成器和推理求解器耦合起来。生成器将与工具相关的标准标准建立在真实工具观察中,并因生成与求解器不断发展的能力边界一致的有效、中等难度的任务而获得奖励。反过来,求解器通过多步骤推理和工具使用从细粒度的满意度信号中学习。我们进一步引入了奖励门控自进化蒸馏(RG-SED),只有当记忆产生经验奖励改进时,它才选择性地将同一策略的记忆增强变体蒸馏回自身,从而减少分布失配并避免盲目模仿噪声指导。最后,为了支持严格的评估,我们推出了 ECR-Bench,这是一个经过专家校准的评估标准基准套件,涵盖单工具深度研究和多工具旅行规划。大量实验表明,ARISE-RL 在所有评估的基准测试中始终如一地实现了稳健的整体最先进性能。
