论文
预算 LoRA:蒸馏 作为高效推理的结构化计算分配
Budgeted LoRA: Distillation as Structured Compute Allocation for Efficient Inference
摘要
我们在显式计算约束下研究 蒸馏 和 大语言模型,目标是生成不仅训练成本更低,而且在推理时结构高效的学生模型。虽然先前的参数高效 蒸馏 方法(例如 LoRA)可以降低适应成本,但它们使密集骨干网保持不变,因此无法提供有意义的推理节省。我们提出了 Budgeted LoRA,这是一个 蒸馏 框架,它将模型压缩视为结构化计算分配问题。我们没有使用固定的学生架构,而是引入了全局计算预算,该预算设置了保留的密集计算的最终目标部分。在此约束下,模型通过(i)模块级密集保留系数,(ii)自适应低秩分配,以及(iii)选择性删除、近似或保留密集组件的 后训练 压缩,在密集和低秩路径上重新分配容量。这个公式产生了一个由单一预算旋钮控制的学生家庭。根据经验,预算 LoRA 在中等预算下与标准 LoRA 困惑度相匹配,压缩模块加速率为 1.74 倍;在激进的预算下,它实现了 4.05 倍的加速,同时适度降低了困惑度,并且在函数式上下文学习探测中保持了更高的准确性。这些结果表明,在计算受限的 蒸馏 下,保留行为与其说是匹配困惑度或删除更多参数,不如说是控制如何将密集计算转移到低秩路径。