论文

TRACE:以运行轨迹指导 MoE 的 FP4 强化训练

TRACE: Rollout-Guided Quantization-Aware Training for FP4 Reinforcement Learning of MoE Language Models

摘要

后训练大语言模型 (LLM) 的强化学习 (RL) 在 执行轨迹 生成期间会产生大量计算和记忆开销,这会激励低 精度 执行轨迹 实现高效的 RL 训练。然而,现有的 FP4 RL 方法存在一个关键限制:它们主要独立优化训练和 执行轨迹 路径上的量化精度,而不是直接减少两个量化执行路径之间的差异。在这项工作中,我们提出了 TRACE (Train-执行轨迹 Quantization Alignment via Compact GuidancE),这是一种用于混合专家 (MoE) 语言模型的 RL 训练的 FP4 量化框架,解决了现有 FP4 RL 方法的局限性。 TRACE 结合了 执行轨迹 引导的量化感知训练,它使用 执行轨迹 端量化结果来指导训练端 FP4 舍入决策,直接减少训练执行轨迹 差异。此外,TRACE采用高效的量化信息缓存方案,有选择地保留来自更深层的尾数和比例信息,以减少执行轨迹引导引入的存储和通信开销。我们在四种大型 MoE 语言模型上评估 TRACE,涵盖推理、编码和长期 RL 任务。我们的结果表明,TRACE 可实现联合 FP4 权重/激活和 FP4 KV 缓存 执行轨迹,其 RL 性能与 BF16 执行轨迹 相当,同时与 BF16 训练的策略的事后 FP4 量化相比,实现高达 5.4 倍的推出加速和强大的最终 FP4 性能。

TRACE:以运行轨迹指导 MoE 的 FP4 强化训练:论文原图
图 3:不同 FP4 RL 方法下训练 – 执行轨迹 差异的两个示例。