论文
任务特定LLM蒸馏的缩放律
Scaling Laws for Task-Specific LLM Distillation
摘要
大语言模型(LLM)在日益增多的领域取得强劲表现——但其规模在延迟与成本约束关键的应用中带来部署挑战。本文推导领域特定LLM压缩的经验缩放律——量化域内与通用知识性能如何随数据集规模、压缩比、监督格式与迭代剪枝日程扩展。以量化金融为应用域——我们在迭代结构剪枝下比较基于logit与基于LoRA的蒸馏——引入在推理踪迹上稳定KL散度蒸馏的混合思维链监督损失。域内任务质量在压缩下可预测地退化——而通用知识基准远早于同一节点崩塌;监督格式是该权衡的关键驱动——思维链监督主动恢复被剪枝抹除的通用知识。我们发布主数据集FinHeadLineMix、缩放律结果与实践建议——为领域特定压缩决策提供可复用框架。
