论文

表格基础模型的注意力量化

Attention Quantization for Tabular Foundation Models

摘要

随着最近表格基础模型的兴起和采用,优化其推理性能成为效率研究的一个新兴领域。虽然这些模型在架构上与基于 Transformer 的大型语言模型 (LLM) 相似,但大小和服务模式却存在显着差异。我们表明,重点应该放在注意力计算上,而不是权重或 KV 缓存量化上,这些在 LLM 中更流行。我们为 FP8 的查询、键和值开发了量化策略,并使用显式的 FP8 矩阵乘法指令来加速注意力计算。我们发现将测试行中的量化误差与训练行中的量化误差对齐至关重要,否则精度会急剧下降。我们的 Triton 内核比常规 16 位内核实现了高达 1.7 倍的加速,并且我们表明,在 TabPFN-v3 和 TabICLv2 上,TabArena 和 BeyondArena 没有相关的准确性损失。