论文
FBLayout:面向移动GPU上高效LLM微调的内存布局优化
FBLayout: Optimizing Memory Layout for Efficient LLM Finetuning on Mobile GPUs
摘要
基于Transformer的模型在语言、视觉和多模态任务上带来了前所未有的能力。在设备端微调Transformer模型为个性化AI提供了一条保护隐私的路径,但由于严格的内存约束以及训练期间注意力机制中频繁的布局变换,它在移动GPU上仍然低效。现有移动训练框架要么在前向与反向传播中使用统一布局——导致反向传播期间内存访问碎片化和GPU利用率低下——要么依赖显式的布局转换,从而引入显著的变换开销。为克服这些问题,我们提出FBLayout,一个将张量组织与移动GPU平台协同设计的布局感知框架。FBLayout引入了:(1)一个用于前向/反向传播中多维归约的统一R-Tile布局;(2)基于tile的索引变换以消除物理数据搬移;(3)激活引导的布局选择以在全局传播高效布局。在多款手机(包括ARM Mali和高通Adreno GPU)上对七个Transformer模型的评估表明,FBLayout相较MNN、TFLite和TVM取得2.2-5.7倍加速,同时显著提升缓存效率并降低内存占用,使设备端大模型微调切实可行。
