论文

RAPTOR:针对混合专家的角色意识私人训练

RAPTOR: Role-Aware Private Training for Mixture-of-Experts

模型训练模型架构MoE监督微调与指令调优

摘要

差分私有 (DP) 微调 方法将稀疏专家混合 (MoE) 模型视为单个密集块,忽略共享层查看所有数据,而专家仅查看路由记录。我们识别并正式描述了三种由此产生的故障模式:全局裁剪抑制专家梯度,批量级归一化稀释稀疏专家更新,固定隐私噪声降低低负载专家的信噪比。我们引入了 RAPTOR - 一个角色感知的私人训练框架,它交替共享和专家优化,并直接针对每个失败,使用专家特定的裁剪和噪声以及公共预期所有者分母和与计数无关的更新计划,避免对私人的、已实现的专家计数进行调节。我们证明所得到的机制满足 $(\varepsilon,δ)$-DP:因为每条记录都分配给一个所有者专家,一层内的每个专家机制并行组成,因此从隐私角度来看,更新所有 $E$ 专家的成本并不比更新一个专家的成本高,共享流和专家流在训练中按顺序组成。我们进一步推导出公共分母估计量的偏差-方差分解,显示其偏差随着路由不平衡而可预测地增长,从而产生一个无隐私规则,用于选择要保护哪一层免受在小型公共语料库上测量的路由熵的影响。在 Switch Transformer 和 OLMoE 微调 上跨 GLUE 任务以及 DeepSeek-VL2-Tiny 上进行的实验表明,在多个隐私级别 ($\varepsilon$) 上,与标准 DP 基线相比具有一致的增益,通常在最紧张的预算下获得最大的利润。代码和模型已公开:https://github.com/leduckhai/RAPTOR