论文
层并行推理减少了 Transformer 中的加密非线性深度
Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers
摘要
完全同态加密(FHE)可以对加密数据进行计算,但实际的加密 Transformer 推理受到许多非线性块的顺序组合的瓶颈。我们研究结构化牛顿层并行性 (SNLP) 是否可以使这种层间组合更加 FHE 友好:每个 Transformer 块仍然需要多项式近似来进行 softmax 和 RMSNorm 等操作,但 SNLP 将分层顺序非线性深度从 L 级减少到少量求解器迭代加上线性结构化校正。使用基于切比雪夫多项式近似的仿真框架,我们测量了 8 个模型和 4 个架构系列的顺序推理与 SNLP 推理下的误差累积。在 0.5B IDN 训练模型上,SNLP 将符号引导从 53 减少到 20 (2.65 倍),困惑度仅降低 + 1.2%,同时降低误差放大(1.36 倍与 1.42 倍)。在所有测试模型中,SNLP 的放大率低于顺序推理。消融表明,softmax 近似在误差预算中占主导地位,并且 CKKS 算术噪声在我们的设置中可以忽略不计,这表明 SNLP 是对块级 FHE 友好算子设计的补充,而不是替代它。