论文

LLM RL 后训练 中用于低成本故障再现和诊断的 MoE 代理模型

MoE Proxy Models for Low-Cost Failure Reproduction and Diagnosis in LLM RL Post-Training

摘要

大语言模型 (LLM) 的强化学习 (RL) 后训练 计算量大,涉及复杂的系统管道,具有大量调试开销。在实践中,框架适配、数值精度和算子实现等因素可能会导致失败,包括梯度溢出和损失发散。直接在大型模型上重现此类故障需要大量时间和计算资源。本文系统分析了华为Ascend平台上大规模强化学习训练中遇到的故障,总结了具有代表性的故障类型,并识别了与故障再现相关的三个模型侧因素。基于这些因素,我们提出了一种用于低成本故障调查和辅助诊断的代理模型构建方法。它采用保留结构、基于聚类的专家剪枝来选择代表性专家,同时保留模型的骨干架构、路由机制和基本任务能力。我们的实验结果表明,代理模型将加速器要求降低了 50%-87.5%,每步 NPU 小时成本降低了 33.3 倍,同时保留了主要的训练动态并再现了与原始模型一致的故障响应。总体而言,代理模型可以作为 RL 后训练 中的故障再现、针对性验证和辅助诊断的低成本代理。