论文

用于消费类 GPU 上的个性化设备上 SLM 的节能和内存高效 PEFT 方法

Energy- and Memory-Efficient PEFT Methods for Personalized On-Device SLMs on Consumer GPUs

模型评测评测方法与指标

摘要

尽管 大语言模型 (LLM) 取得了快速进步,但由于 VRAM、时间和能源成本较高,在资源受限的设备上部署和个性化它们仍然不切实际。小语言模型 (SLM) 的参数高效 微调 (PEFT) 提供了一种有前途的替代方案,但很少有研究在考虑能耗的同时使用通用基准和个性化基准来比较跨架构的 PEFT 方法。我们在三个 GLUE 任务中比较了来自两个系列的四个 SLM(基于 Transformer:TinyLlama-1.1B、Qwen3-1.7B;基于 SSM:Mamba-1.4B、Mamba-2-1.3B)的五种 微调 方法(Full 微调、LoRA、LoRA+、QLoRA 和 BitFit)。 (SST-2、QNLI、STS-B)和三个 LaMP 个性化任务(LaMP-1、LaMP-2、LaMP-3)。每个配置均使用以能源为中心的 NetScore-E 和以内存为中心的 NetScore-M 进行评估,这两个变体反映了设备部署的约束条件。方法的选择遵循严格的能量优先规则(最高 NetScore-E,由 NetScore# 打破平局)。 LoRA+ 在 24 种配置中的 19 种中实现了最高的 NetScore-E,在 24 种配置中的 13 种中实现了最高的 NetScore-M,并且是 24 种配置中的 18 种中选择的方法。QLoRA 仅适用于 Transformer 型号,相对于 LoRA 将峰值微调 VRAM 削减了高达 3.9 倍,因此在 12 种配置中的 5 种中获得了最佳 NetScore-M Transformer 配置,尽管其去量化开销使其在能量决定后仅选择其中一种配置。 BitFit 和完整的 微调 在这两个变体上几乎没有竞争力,TinyLlama-1.1B 在六个基准测试中的五个上领先于以能源为中心的 NetScore-E,在四个基准上领先于以内存为中心的 NetScore-M。这些结果表明,紧凑型 SLM 与 PEFT 相结合,为个性化设备上部署提供了一条实用的、能源感知的路径,并采用由主要约束设置的最佳方法:用于能源的 LoRA+ 和用于内存的 QLoRA。