论文

AI训练管理器:自适应训练配方的有界闭环控制

AI Training Manager: Bounded Closed-Loop Control of Adaptive Training Recipes

智能体系统Agent 架构与控制循环Agent Harness

摘要

我们推出了 AI Training Manager,这是一种基于 LLM 的有界监督控制器,用于自适应机器学习训练。标准训练管道通常依赖于固定配方或单轴调度程序,它们可能会遇到中期运行故障,例如严重过度拟合、损失不平衡、探索崩溃或不安全探索。管理器不是取代数学优化器或充当无约束编码代理,而是通过模式条件接口进行操作:它从活动运行中读取结构化遥测快照,审核受约束的操作空间,并将经过验证的更新返回到训练参数,例如学习率、正则化强度、损失权重系数和探索设置。我们通过监督语言建模和强化学习来评估这种架构。在 TinyStories 上,管理器检测并纠正过度拟合,实现验证损失比基线低 60%,同时生成可审计的干预日志。在这种监督设置中,我们还表明管理器推理不需要阻止训练循环:训练可以在管理器响应挂起时继续进行,并且一旦可用,可以异步应用经过验证的更新。在机器人操作强化学习任务中,我们在情景闭环设置中使用相同的有界决策接口,其中管理器更新应用于评估或检查点边界。管理者减少了保守和不安全的勘探制度。这些结果表明,模式条件大语言模型可以充当实时训练运行的有界监督管理器,通过可解释的多轴干预功能补充传统的优化器和调度器

AI训练管理器:自适应训练配方的有界闭环控制:论文配图
图 1:健康的 TinyStories 基线。通过 20k 个训练故事和 2k 个验证故事,标准余弦退火配方可产生稳定的运行:训练和验证损失均平稳减少,并且训练验证差距仍然很小。