Frontis-MA1:训练 AI4AI 模型以实现机器学习工程中的递归自我改进
Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering
摘要
递归自我改进(RSI)需要人工智能系统改进构建人工智能的过程(即AI4AI);机器学习工程(MLE)为研究这种能力提供了一个具体的、可执行的测试平台。我们推出 OpenMLE,这是一个用于 MLE 中 RSI 研究的开放式全栈系统,涵盖具有执行反馈 (OpenMLE-Gym)、算子学习 (OpenMLE-RL) 和长视野搜索 (OpenMLE-Evo) 的可验证任务环境。在此堆栈上,我们将 Frontis-MA1 (35B) 后训练为 MLE 的元进化代理,对齐 后训练 并围绕四个原子程序进化运算符(草稿、改进、调试、交叉)进行推理:通过基于执行的 SFT 和 RL 对所有评估基准进行重复数据删除的数据进行训练,然后将其组合成长期搜索、耦合学习和单个循环中的进化。在 MLE-Bench Lite 上,在一台 RTX 4090(上限为 12 GB VRAM)上,每任务预算为 12 小时,Frontis-MA1 (35B) 与使用 OpenMLE-Evo 的基本模型相比,将奖章平均数从 39.39% 提高到 60.61%,而使用 OpenMLE-Evo-Max(独立于基准的经验先验和异步搜索)则达到 71.21%,超过GPT-5.5 + Codex 以及接近的 GPT-5.6 Sol 和 2.8T Kimi K3。在保留的 NatureBench Lite 上,两个组件都发生了转移:在框架固定的情况下,交换训练模型将 Match-SOTA 从 50% 提高到 70%;模型固定后,更换 OpenMLE-Evo 可将其从 20% 提高到 50%。我们发布了模型权重和完整的 OpenMLE 堆栈,以便能够针对 RSI 的可执行 AI4AI 进行可重复的研究。代码:https://github.com/FrontisAI/OpenRSI