fp8 中的快速矩阵乘法:经过认证的系数优化和测量误差
Fast Matrix Multiplication in fp8: Certified Coefficient Optimization and Measured Error
摘要
Strassen 型算法有许多实现,它们具有相同的精确乘积和乘法计数,但具有不同的 fp8 误差,因为基数改变了重塑系数几何形状,从而提出了运行哪个算法的问题。没有经常账户可以解决这个问题:经典稳定性控制最坏情况的 $\ell_1$ 增长,而不是预期误差大小,而 Dumas-Pernet-Sedoglavic 优化器只能被称为可能最优,其全局最优性尚未得到证明。为了解决这个问题,我们为每个实现附加一个系数泛函 $\Phi$,它是其系数几何的标量总结,我们在基差变化轨道上将其最小化。 Hadamard 流形上的 Kempf--Ness 问题让我们能够证明全局 $\Phi$ 最优值,而不仅仅是搜索它:精确的矩映射零修正 $\Phi_{\min} = 200/9$,而 de Groote 的分类将该最优性扩展到每个精确的实数 7 阶 $2\times2$ 分解。因此,在固定噪声系数下,每个精确的真实 7 阶实现都具有 $\Phi$ 预测的 RMS 常数,至少为三次算法的 $5/3$ 倍。然后,我们引入一个显式的块尺度 e4m3 模型,其中 $\Phi$ 是相对预期均方误差的前导系数,并且我们根据实现的 fp8 误差测试生成的 $\Phi$ 预测排序。排序和重新定基实验支持在测试的融合块尺度机制内的预测,并且在来自四个架构系列的真实 matmul 块上,$\Phi$ 最优实现落在 fp8 低误差区域中。在真正的 deep_gemm 内核上的两个 $\sim$70B 模型中,相同的实现消除了经典 Strassen 相对于干净模型的多余 NLL 的 10% 到 55%。因此,算法实现成为一个经过数学认证的设计问题,而不是一个调整选择:具有全局 $\Phi$ 最佳值和测量的 fp8 相关性的独立低精度轴。