论文

FED-FSTQ:Fisher 引导的词元量化,用于边缘设备上 LLM 的通信高效联合 微调

FED-FSTQ: Fisher-Guided Token Quantization for Communication-Efficient Federated Fine-Tuning of LLMs on Edge Devices

模型训练参数高效训练

摘要

联合 微调 提供了一种在边缘设备上适应 大语言模型 (LLM) 的实用途径,而无需集中私有数据。然而,在移动部署中,训练挂钟通常由异构带宽、间歇性参与和非 IID 客户端数据下的落后者限制的上行链路通信主导。尽管 LoRA 和 QLoRA 等参数高效的 微调 (PEFT) 方法减少了本地内存和可训练参数,但适配器更新的重复传输仍然是主要瓶颈。我们提出了 Fed-FSTQ,一种语义敏感性感知的通信控制原语,用于高效通信的联合 LLM 微调。 Fed-FSTQ 使用轻量级 词元级 Fisher 代理来估计语义敏感性,将词元引导的稀疏化与混合精度适配器更新量化相结合,并为语义承载证据分配更高的通信保真度,同时抑制冗余传输。该方法与标准联合 PEFT 管道直接兼容,并且不需要更改服务器聚合规则。非 IID 分区下的多语言 QA 和医学 QA 实验表明,相对于 Fed-LoRA 基线,Fed-FSTQ 将达到固定质量阈值所需的累积上行链路流量减少了 46 倍,并将落后者限制的挂钟时间准确度提高了 52%。在修正后的受控 LTE-20Mbps 计算下,Fed-FSTQ 将每轮时间从 414.60 秒减少到 67.29 秒,并将每轮能量从 839.20J 减少到 146.28J,从而实现 6.16 倍的加速。在 NVIDIA Jetson 级边缘设备上,Fisher 引导的词元缩减还可实现高达 1.55 倍的推理加速,展示了在严格资源限制下的可部署性。