论文
LoRA 生成超网络,用于高效的设备上 LLM 生成个性化
LoRA-generating hypernetworks for efficient on-device LLM generative personalization
摘要
设备上的大语言模型(“LLM”),例如在手机上运行的软件,通过个性化进行改进的时机已经成熟。移动设备有限的计算资源限制了模型规模,从而限制了模型质量,使得任何可实现的质量收益都具有高度影响力。同时,他们的个人性质(即与特定用户的紧密耦合)意味着,随着时间的推移,给定的设备上大语言模型往往会以类似的、可预测的模式使用。本文提出了一种个性化设备上大语言模型的新方法。它训练超网络将用户的上下文标记映射到非常适合该用户的低秩适应(“LoRA”)。一旦经过训练的通用工件被部署到用户的设备上,每个用户就可以使用超网络来合成(完全在设备上)个性化的 LoRA。这种方法融合了 LLM 定制的两种现有方法的优点,同时避免了缺点:上下文学习(“ICL”)和参数高效微调(“PEFT”)。与 ICL 一样(与 PEFT 不同),我们方法的设备端阶段在计算上是可行的,只需要通过神经网络进行前向传递。与 PEFT 一样(与 ICL 不同),我们的方法通过权重(LoRA)修改“目标”基础 LLM,避免与扩展输入序列相关的负面后果(例如延迟增加)。我们的方法特别适合移动设备体系。除了提到的设备上计算和延迟优势之外,它还需要最少的额外存储,因为其架构在内部部分利用了与属于要个性化的目标 LLM 相同的 LLM 权重。我们在几个具有代表性的个性化数据集上展示了 LoRA 生成超网络的优势,并与 ICL 和 PEFT 等基线进行比较。值得注意的是,我们的个性化实验侧重于更具挑战性且研究较少的长文本生成任务。