论文

TRIAGE:稳定原生 NVFP4 强化学习的方向感知重平衡

TRIAGE: Direction-Aware Mismatch Stabilization of Native NVFP4 Reinforcement Learning

模型训练强化学习

摘要

低精度执行能够加速大语言模型强化学习,但学习器与采样器的执行失配会破坏策略优化。本文刻画失配与策略梯度方向的交互,区分局部放大与收缩的更新贡献;仅测失配幅度不能识别这一区别。在原生NVFP4运行中,我们观察到两个放大区域在早期失衡,偏向负优势、负差值更新;失配向全局扩散前,尾部词元集中在少量响应段。由此提出方向感知稳定方法TRIAGE,按段诊断选择性重平衡策略梯度,并对剩余严重失配进行有界修复。它修改优化目标,同时让学习器与采样器保留原生NVFP4权重和激活4位(W4A4)前向执行。在Qwen3-4B和Qwen3-30B-A3B上,整个被评训练区间优化稳定,在五个数学推理基准达到全精度水平;原生NVFP4加TRIAGE的采样吞吐最高为BF16的2.3倍。

TRIAGE:稳定原生 NVFP4 强化学习的方向感知重平衡:论文原图
图4:Qwen3-30B-A3B-Base与Qwen3-4B-Base的训练动态。横轴为优化器步数,从左至右为熵损失、训练奖励及训练与采样对数概率差值的平均绝对值。