论文
CurveFP:共同设计语言模型的数值表示和乘积算法
CurveFP: Co-Designing Numerical Representation and Product Arithmetic for Language Models
摘要
低精度格式通常会优化标量保真度,同时继承传统的乘积算法。我们引入了 CurveFP,一个块尺度系列,它将幅度分布在交错的对数曲线上。统一曲线索引使每个非零乘积成为精确的符号和整数索引更新,而有理基数则揭示了累加所需的有限阶段调度。我们将代数实例化为 CurveFP8 E4C3/E5C2 用于训练,实例化为 CurveFP7 E3C3 用于紧凑推理。在四个 7B-9B 模型上,CurveFP7 以更少的元素位击败了张量 FP8 困惑,并且保持在原始质量的 1.32% 以内。 CurveFP8 降低了所有 36 个配对训练-GEMM 比较中的误差。在三个匹配的 3B 词元预训练三元组中,它达到平均 BF16 推理困惑度 22.5366,而 FP8 为 22.5407,并且每个种子的格式惩罚较低。下游评估显示传输奇偶性和一致的 WikiText-103 增益。在初步的 4x4 Nangate45 空间加速器块中,CurveFP8 比 500 MHz 的定时关闭 FP8 少使用了一个乘积寄存器,并且面积减少了 4.6%。这些结果支持 CurveFP 作为数值和算术协同设计,同时将系统级效率留待未来研究。