论文

Miles v0.1:生产级 后训练

Miles v0.1: Production-Level Post-Training

AI 基础设施AI 开发与运维平台

摘要

我们推出 Miles v0.1,这是一个适用于前沿 后训练 的全栈、生产就绪系统。基于 Slime 的简洁设计,Miles 围绕一个原则设计了强化学习 (RL) 训练循环的每个阶段:组件应该经过验证、简洁和可定制。 Miles 将准确性、效率、可靠性和可扩展性作为首要目标,旨在让研究人员和企业都能使用前沿规模的强化学习。本报告端到端地介绍了系统:基于 SGLang 构建的轨迹采样引擎、可选择两个后端(NVIDIA Megatron-LM 和 PyTorch FSDP)的训练器以及用于不同部署拓扑的三种权重同步传输。除了全参数 RL 之外,Miles 还支持 LoRA RL、同策略 蒸馏、监督 微调 和 严格同策略的采样—训练对齐,并将相同的架构扩展到扩散模型。我们以一个端到端案例研究作为结束语:在终端使用编码任务上,在 GLM-5.2 744B-A40B 模型上进行完全异步代理强化学习,在 64 个 NVIDIA GB300 GPU 上运行,前 30 个测量步骤的中位步骤时间为 263 秒。 Miles 在 https://github.com/radixark/miles 上开源,项目网站为 https://miles.radixark.com。