论文

A-Evolve-Training:30B模型的自主后训练

A-Evolve-Training: Autonomous Post-Training of a 30B Model

智能体系统Agent 架构与控制循环

摘要

前沿模型的后训练通常需要数周的人工工作:提出数据和配方更改、启动运行、读取评估、决定保留什么。我们报告了一个自治系统,该系统在无人参与的情况下运行此循环,在数周内对 30B Nemotron 进行四轮训练。在 NVIDIA Nemotron 推理挑战赛公共排行榜上,自主生成的模型获得了 0.86 分,而人类提交的最高分为 0.87 分,在撰写本文时在约 4000 分中排名第 8。比数字更引人注目的是:循环检测到自己的开发指标已经停止跟踪最弱领域的外部表现——候选者在不改变外部目标的情况下将开发推向历史新高——并修改了自己的搜索策略,不再最大化开发,而是寻求干预措施,在改善外部目标的同时降低现在误导性的代理。我们将其视为直接的、可审计的证据,表明规模化的自主循环可以产生发现,而不仅仅是优化:它检测到其测量框架已变得具有误导性,并改变了作为证据的内容。我们认为,任何值得贴上“递归自我改进”标签的系统最终都必须执行前沿级模型的端到端后训练;这是被清除的柱的一个数据点。我们并不声称人类研究人员是“第一次自主匹配”。我们提出的主张范围更窄且可审计:据我们所知,这是第一次公开报道的这种规模的自主训练后运行,之前的公共自主机器学习研究演示的预算为 GPT-2 级(约 1.24 亿)。同一系统还对 120B 和 550B Nemotron 进行后训练;由于没有公共人类基线,这仅表明循环在该规模上闭合,而不是其产出具有竞争力——基础设施证据,其有效性主张被推迟到存在可比较的人类锚点。

A-Evolve-Training:30B模型的自主后训练:论文配图
图 2:系统概览。每轮都会将一个不可变的操作员审核基质(默认/)分叉到 NN 个候选沙箱中。无内存工作人员探索当前轮研究策略分配的轴,调度真实的 GPU 训练作业,在多个检查点进行评估,并编写结构化结果摘要。审阅者将工作人员的输出交叉读取为固定模式摘要;受宪法约束的协调器仅在冻结的元提示下更新下一轮的研究策略。默认基底永远不会被覆盖,跨轮状态简化为滚动研究策略和统一的发现日志。