论文
FLoKD:面向无线网络的联邦低秩大语言模型自适应知识蒸馏
FLoKD: Adaptive Knowledge Distillation for Federated Low-Rank LLM over Wireless Networks
摘要
大语言模型(LLMs)在多种自然语言处理任务中表现出强大能力。然而,传统微调依赖中心化数据收集,带来隐私问题。联邦学习(FL)可在不共享原始客户端数据的情况下实现协作微调,但其在带宽受限的无线网络中的部署受到模型参数传输带来的通信开销限制。尽管低秩适应(LoRA)减少了可训练参数数量,其通信成本仍随模型规模增加。知识蒸馏通过输出logits避免参数共享,但LLM中的token级logits因序列长度和词汇量大导致通信成本高昂。降低logits可减少通信开销,但会削弱监督信号并降低准确率。为解决这些问题,我们提出FLoKD,一种用于在无线网络上进行联邦LoRA微调的自适应知识蒸馏框架,该框架以中间LoRA激活作为蒸馏信号,而非logits或完整参数。由于在全公开数据集上传输所有块仍成本高昂,我们进一步提出一种Transformer块重要性评分框架,选择性地传输最具信息量的块,并设计两种数据集选择策略:剔除偏离本地数据分布的公共样本,优先选择对蒸馏最有帮助的样本。在多个生成式语言数据集(包括WikiText-103、PTB和Dialog)上的广泛实验表明,所提框架将通信开销降低50-65%,同时快速收敛到与基线相比有竞争力的困惑度。
