论文
Transformer 可扩展性危机:现代语言模型中性能墙的首次全面实证分析
Transformer Scalability Crisis: The First Comprehensive Empirical Analysis of Performance Walls in Modern Language Models
摘要
尽管 Transformer 架构在自然语言处理方面取得了显着的成功,但通过系统的实证分析,人们对它们的可扩展性限制仍然知之甚少。本文首次对跨七个不同架构类别的 118 个 Transformer 模型进行了全面的大规模评估,揭示了表现为硬部署约束的基本性能墙。我们的系统基准测试方法揭示了一个关键的可扩展性危机:虽然 88.1% 的模型成功处理最多 512 个词元的序列,但在 1024 个词元时,这一比例急剧下降至 44.9%,在 2048 个词元时完全失败 (0%)。通过对 128 到 2048 个词元的序列长度的加载时间、内存消耗和计算效率进行严格分析,我们证明与大型生成模型(12.5 个词元/秒/M)相比,压缩模型实现了卓越的参数效率(649.2 个词元/秒/M 个参数)。我们的研究结果挑战了普遍的缩放假设,并提供了第一个定量证据,证明理论 O(n2) 注意力复杂性转化为可测量的性能墙。这项工作为 Transformer 评估建立了新的基准测试方法,并为生产环境中的实际部署决策提供了重要的见解。