从专家约简到行为发散:通过稀疏 MoE 推理追踪数值状态
From Expert Reduction to Behavioral Divergence: Tracing Numerical State through Sparse MoE Inference
摘要
数学上等效的专家归约顺序可以产生明显不同的稀疏 MoE 执行。我们通过冻结本地 MoE 状态并仅改变聚合语义来隔离本机 DeepSeek-V4-Flash 中的这种影响。四种方案将操作数表示与累加器精度分开。一层5分叉,720个A模式订单产生10个延续盆地; 720 个 B 模式阶次形成 360 个精确的构造类别和 11 个盆地。在中国的一项提示下,B 级员工分为 202 名裁员、113 名招聘和 45 名其他续聘。最大 L 无穷大 B 分支选择将 50 个提示中的 12、24 和 36 个按 8、16 和 32 个标记分开。在每个方案的 192 个持久轨迹中,P32、A 和 B 更改每个本机参考路线轨迹,而 C 保留路线、词元序列和文本。单独的 192 轨迹 C 检查按位匹配本机 MoE、后 mHC、下一个路由器和 LM 状态。对于一个受控 B 分支,精确的 mHC 终点重建可重现测量的下游轨迹。在下一个解码边界,给定相同的自然生成的下一个输入,分支完整持久状态的精确 FP64 重建在七个步骤中产生 301 个下游后 mHC 状态、301 个持久状态检查点、301 个路由、预测和文本的协议。这些控制将后 mHC 识别为词元内边界,将完全持久状态识别为跨词元延续边界。相同的标记不一定意味着相同的自回归状态:分歧可以在标记边界后继续存在并在以后变得可见。这些结果使专家操作数转换、累加器精度和降序成为稀疏 MoE 运行时和硬件后端的数值兼容性契约的一部分。他们建立受控的因果可能性,而不是部署事件; C 的阶数不变性仅限于评估的六项状态和时间表。