论文

RSI-Master:构建实验来指导自主模型改进

RSI-Master: Structuring Experiments to Guide Autonomous Model Improvement

智能体系统Agent 协作

摘要

递归自我改进(RSI)旨在使人工智能系统能够参与提高自身能力。一个具体的途径是自主模型开发,其中Agent迭代地探索训练后策略以改进基础模型。这种设置面临两个挑战:Agent可能会通过黑客攻击来利用开放式实验行为,而重复实验可能会导致策略锁定,即对早期方向进行细化而不是重新考虑。我们引入RSI-Master,它从两个层面解决了这两个挑战:规范分步行动,避免黑客行为,促进研究方向的结构性探索,避免策略锁定。 RSI-Master 由一个实验操作系统和一个审稿人引导的研究编排组成,前者支持规范化的实验操作,并维护持久、可追踪的实验记录,后者将工作人员和审稿人组织在动态增长的研究 DAG 中。工作人员探索不同的研究方向,审稿人比较相关实验的证据以进行后续探索。在使用 Qwen3-4B-Base 的 PostTrainBench 上,最强Agent基线的平均得分为 54.49,而最强Agent基线的平均得分为 46.53,黑客攻击率为 0.0\%。扩展到 35B 模型后,RSI-Master 在 LiveCodeBench-v6(41.21 vs. 37.36)和 SciCode 上超越了人类开发的 Instruct 模型,并在 Horizo​​nMath 上达到了非零分数,Horizo​​nMath 是未解决的研究问题的基准,大多数前沿模型的得分接近于零。