论文

任务特定LLM蒸馏的缩放律

Scaling Laws for Task-Specific LLM Distillation

模型优化模型压缩

摘要

大语言模型(LLM)在日益增多的领域取得强劲表现——但其规模在延迟与成本约束关键的应用中带来部署挑战。本文推导领域特定LLM压缩的经验缩放律——量化域内与通用知识性能如何随数据集规模、压缩比、监督格式与迭代剪枝日程扩展。以量化金融为应用域——我们在迭代结构剪枝下比较基于logit与基于LoRA的蒸馏——引入在推理踪迹上稳定KL散度蒸馏的混合思维链监督损失。域内任务质量在压缩下可预测地退化——而通用知识基准远早于同一节点崩塌;监督格式是该权衡的关键驱动——思维链监督主动恢复被剪枝抹除的通用知识。我们发布主数据集FinHeadLineMix、缩放律结果与实践建议——为领域特定压缩决策提供可复用框架。

任务特定LLM蒸馏的缩放律:论文配图
图 10:按事件类别着色的数据集嵌入的 UMAP 可视化。聚类结构反映了类别内和类别间标题之间的语义相似性。