论文

RSI-Forge:将研究论文转为递归自我改进的执行环境

RSI-Forge: From Research Papers to Environments for Recursive Self-Improvement

模型评测智能体系统Agent 协作智能体自我改进基准与评测资源递归自我改进(RSI)

摘要

环境是递归自我改进的基础:它提供Agent需要解决的问题,以及用于衡量进展的反馈。然而,构建具有挑战性且评测可靠的研究环境仍依赖领域专家,限制了规模和学科覆盖。我们提出RSI-Forge,一个把已发表论文转为可执行自我改进环境的多Agent流水线。三个Agent分别协调构建、复现和审查,生成带有自动评测器的任务;每篇论文的方法还被独立重新实现,以建立基线分数。我们提供18个领域的210个环境,其中90个经过独立人类领域专家审查。专家和Agent评审都认为起始方案具有较大改进空间,评测器也能有效区分方案质量;但专家对防止投机取巧、忠实反映原论文,以及任务是否会被单一想法轻易解决等方面更为严格。为检验这些环境是否适合反复改进,我们让四个模型在120个环境中分别连续尝试三次,每次继承此前的代码和笔记,模型权重保持不变。在84%的环境中,至少一个模型在首次尝试后取得进一步改善。模型还在120个环境中的68个上超过复现的论文方法,表明这些基线之外仍有提升空间。执行记录分析发现,95%的上述成功尝试包含超越参数调节的工作。轨迹分析还显示,得分较低的模型探索更少,更常接受小于所报告标准误差的收益,也更依赖针对开发集调参。RSI-Forge为构建用于训练和评测自我改进Agent的研究环境提供了可扩展的方法。

RSI-Forge:将研究论文转为递归自我改进的执行环境:论文原图
图 1:RSI-Forge 概述以及每个代理可用的信息。失败的检查会导致在环境被接受之前进行修复或拒绝。输出计数包括所有 210 个环境。性能条报告了对从主要构建运行中采样的 120 个环境进行 3 次连续尝试后最终解决方案的中值分数。分数被归一化,使得起始解为 0,目标分数为 1(等式 1)。