论文
A-Evolve-Training:30B模型的自主后训练
A-Evolve-Training: Autonomous Post-Training of a 30B Model
摘要
前沿模型的后训练通常需要数周的人工工作:提出数据和配方更改、启动运行、读取评估、决定保留什么。我们报告了一个自治系统,该系统在无人参与的情况下运行此循环,在数周内对 30B Nemotron 进行四轮训练。在 NVIDIA Nemotron 推理挑战赛公共排行榜上,自主生成的模型获得了 0.86 分,而人类提交的最高分为 0.87 分,在撰写本文时在约 4000 分中排名第 8。比数字更引人注目的是:循环检测到自己的开发指标已经停止跟踪最弱领域的外部表现——候选者在不改变外部目标的情况下将开发推向历史新高——并修改了自己的搜索策略,不再最大化开发,而是寻求干预措施,在改善外部目标的同时降低现在误导性的代理。我们将其视为直接的、可审计的证据,表明规模化的自主循环可以产生发现,而不仅仅是优化:它检测到其测量框架已变得具有误导性,并改变了作为证据的内容。我们认为,任何值得贴上“递归自我改进”标签的系统最终都必须执行前沿级模型的端到端后训练;这是被清除的柱的一个数据点。我们并不声称人类研究人员是“第一次自主匹配”。我们提出的主张范围更窄且可审计:据我们所知,这是第一次公开报道的这种规模的自主训练后运行,之前的公共自主机器学习研究演示的预算为 GPT-2 级(约 1.24 亿)。同一系统还对 120B 和 550B Nemotron 进行后训练;由于没有公共人类基线,这仅表明循环在该规模上闭合,而不是其产出具有竞争力——基础设施证据,其有效性主张被推迟到存在可比较的人类锚点。
