论文

梯度 Transformer:学习为 LLM 生成更新

Gradient Transformer: Learning to Generate Updates for LLMs

摘要

许多组织缺乏计算资源来对私有(不可共享)数据微调 大语言模型 (LLM) 以获得更好的实用性,而 微调 微型语言模型 (TinyLM) 单独表现不佳。为了解决这个瓶颈,我们提出了一个无数据的 知识蒸馏 框架,该框架基于对私有数据进行微调的 TinyLM 生成 LLM 更新向量。更新向量是数据集上从初始模型到其微调版本的参数变化向量,捕获 微调 期间累积梯度步骤的影响。我们框架的关键思想是一种新颖的梯度 Transformer,它将 TinyLM 的更新向量转换为 LLM 的更新向量。从影子数据集派生而来,Grad-Transformer 捕获 TinyLM 和 LLM 更新向量之间的相关性,使第三方提供商能够在给定组织的 TinyLM 更新向量的情况下生成 LLM 更新向量,而无需访问组织的私有数据。该框架支持多组织协作,共同更新LLM,提高性能和成本效率。跨语言建模和推理任务的大量实验表明,即使在严格的差分隐私保护下,Grad-Transformer 也显着优于最先进的 知识蒸馏 基线。