论文

不断发展特定于层的标量函数以实现硬件感知 Transformer 适配

Evolving Layer-Specific Scalar Functions for Hardware-Aware Transformer Adaptation

模型优化端侧模型

摘要

Vision Transformer (ViTs) 在具有挑战性的视觉任务上实现了最先进的性能,但它们在边缘设备上的部署受到计算复杂性和层归一化带来的全局缩减瓶颈的阻碍。最近的方法试图通过用硬件友好的标量近似替换归一化层来绕过这个问题。然而,这些同质替换并不能最佳地适应所有层的行为,并且依赖于昂贵的模型重新训练。在这项工作中,我们提出了一种高效的硬件感知框架,该框架利用遗传编程(GP)直接从预训练的权重演化出异构的、特定于层的标量函数。加上新颖的 后训练 重新对齐策略,我们的方法完全消除了从头开始重新训练模型的需要。我们的进化表达式准确地近似了目标归一化行为,捕获了 $90$-$93\%$ 的方差 ($R^2$),而同质基线仅捕获了 $70$-$76\%$,使得我们修改后的架构仅在 20 个时期内就在 ViT-B 上恢复了 $84.32\%$ Top-1 ImageNet-1K 精度,在 ViT-L 上恢复了 $85.74\%$。通过保持接近基线的精度,同时消除全局缩减瓶颈,与标准 LayerNorm 相比,我们的方法实现了算术复杂性和片外内存流量的严格降低,消除了在边缘加速器上高效部署 ViT 的主要障碍。