论文
RSI-Forge:将研究论文转为递归自我改进的执行环境
RSI-Forge: From Research Papers to Environments for Recursive Self-Improvement
摘要
环境是递归自我改进的基础:它提供Agent需要解决的问题,以及用于衡量进展的反馈。然而,构建具有挑战性且评测可靠的研究环境仍依赖领域专家,限制了规模和学科覆盖。我们提出RSI-Forge,一个把已发表论文转为可执行自我改进环境的多Agent流水线。三个Agent分别协调构建、复现和审查,生成带有自动评测器的任务;每篇论文的方法还被独立重新实现,以建立基线分数。我们提供18个领域的210个环境,其中90个经过独立人类领域专家审查。专家和Agent评审都认为起始方案具有较大改进空间,评测器也能有效区分方案质量;但专家对防止投机取巧、忠实反映原论文,以及任务是否会被单一想法轻易解决等方面更为严格。为检验这些环境是否适合反复改进,我们让四个模型在120个环境中分别连续尝试三次,每次继承此前的代码和笔记,模型权重保持不变。在84%的环境中,至少一个模型在首次尝试后取得进一步改善。模型还在120个环境中的68个上超过复现的论文方法,表明这些基线之外仍有提升空间。执行记录分析发现,95%的上述成功尝试包含超越参数调节的工作。轨迹分析还显示,得分较低的模型探索更少,更常接受小于所报告标准误差的收益,也更依赖针对开发集调参。RSI-Forge为构建用于训练和评测自我改进Agent的研究环境提供了可扩展的方法。
