论文

RSIGym:支持递归自我改进的Agent研究环境

RSIGym: A Flexible Environment for Recursive Self-Improvement

智能体系统AI 基础设施Agent任务评测智能体自我改进Sandbox

摘要

递归自我改进需要把已接受的改动带入后续改进周期,而研究Agent提出的改动也需要大量研究基础设施。已有环境经常让Agent重复建设常规基础设施,或将探索限制于单个组件。我们提出RSIGym,一个基于“一切即服务”(EaaS)的Agent原生研究环境。它将训练、推理、Rollout、评测和沙箱执行开放为可复用服务,以共享预算与权限控制支持Data、Harness和Joint三条改进路径。Agent可以在同一环境内研究单项干预,也可联合优化数据、训练设置和执行Harness。我们定义RSI-Index:在软件工程、终端交互、数学、科学推理和技能任务五个基准上,剩余性能差距被缩小的平均比例。在六个前沿研究模型各自独立的Joint运行中,Opus 5在每个基准运行500美元的平台服务预算下,取得最高RSI-Index 0.4809。其选定系统改善全部五个基准,将SWE-bench Verified从17.67%提高到50.33%,AIME从31.67%提高到97.78%。额外实验考察DSH Harness细化、不同预算和限制网络访问的情况;记录的轨迹展示Agent如何诊断失败及选择候选改动。完整RSIGym代码与结果开放,以支持复现和进一步研究。