Agent^2 RL-Bench:LLM智能体能否工程化实现agentic RL后训练?
Agent^2 RL-Bench: Can LLM Agents Engineer Agentic RL Post-Training?
摘要
我们引入了 Agent^2 RL-Bench,这是一个评估代理 RL 训练后的基准——LLM 代理是否可以自主设计、实现和运行完整的 RL 管道来改进基础模型。这种能力很重要,因为 RL 训练后越来越多地推动模型对齐和专业化,但现有的基准在很大程度上仍然是静态的:仅监督微调就可以产生强大的结果,而交互式 RL 工程未经测试。 Agent^2 RL-Bench 通过三个级别的六项任务来解决这个问题——从基于规则的静态训练到带有轨迹收集的闭环在线强化学习——每个任务都增加了先前级别没有强加的结构要求。该基准测试为隔离的工作区提供了评分 API、记录每次提交和代码修订的运行时检测以及生成结构化运行报告的自动事后分析,从而实现了对代理驱动的训练后行为的首次自动诊断。在跨越 5 个代理系统和 6 个驱动程序 LLM 的多个代理堆栈中,我们发现代理实现了惊人的交互收益 - 在 ALFWorld 上,仅 RL 代理通过 SFT 预热和 GRPO 在线部署,从 5.97 提高到 93.28 - 但在其他代理上只取得了边际进步(DeepSearchQA:评估噪声内 +2.75),并且驱动程序的选择对交互任务有很大影响 - 在同一个脚手架中,切换驱动程序将交互改进从接近零更改为+78 页。更广泛地说,该基准表明,在固定预算下,有监督的管道在代理驱动的后期培训中占主导地位,在线强化学习仅在 ALFWorld 上成功成为最终最佳路线。代码位于 https://github.com/microsoft/RD-Agent/tree/main/rdagent/scenarios/rl/autorl_bench。
