论文
表格基础模型注意力:按行列形状与GPU选择后端
Benchmarking Attention for Tabular Foundation Models
摘要
TabPFN、Mitra 或 ConTextTab 等表格上下文学习器依赖于潜在嵌入的 2D 序列上的交替行和列注意力。这些注意力模式与语言模型中的一维情况明显不同:行注意力涉及较长的序列,而列注意力则作用于较短的序列,并且表格数据的跨步内存布局使得生成连续张量的成本很高。此外,与最近的语言模型相比,当前模型中使用的隐藏维度很小。然而,有效注意力主要针对一维序列进行研究,而二维表格设置尚未探索。为此,我们创建了一个可重复的基准测试设置,并研究了多个后端的表格注意力的独特特征 - Torch SDPA(高效和 cuDNN)、FlashAttention-2/3/4 以及仅推理后端 vLLM 和 SageAttention - 测量三代 GPU(A100、H100、B200)上真实表格形状的前向和后向吞吐量。我们发现,最佳后端选择在列注意力和行注意力之间有所不同,并且因硬件和模型细节而异:虽然为每一代 GPU 定制的 FlashAttention 实现总体上表现最佳,但在较长序列上的列注意力(具有取决于头部尺寸的交叉点)的情况下,它们有时会被cuDNN超越。在仅推理后端中,SageAttention 在行注意力和超过 16k 行的大型序列方面表现良好。我们的可重复基准为未来改进表原生注意力奠定了基础。独立的基准测试和评估代码可在以下位置公开获取:https://github.com/SAP-samples/tabular-attention-benchmark