论文
SLAP:用于 同策略 数据高效指令调优的分层基于损失的修剪
SLAP: Stratified Loss-based Pruning for On-Policy Data-Efficient Instruction Tuning
摘要
指令调优优化了大语言模型(LLM)的专业能力,但它通常需要大量的数据集和较长的训练时间。挑战在于通过有效识别有用数据来开发特定功能 微调。高质量、多样化的剪枝数据可以帮助模型以更低的成本实现无损性能。在本文中,我们提出了 \textbf{SLAP},一种新颖的批量感知数据选择框架,用于评估整个批量组合而不是单个组合的可学习性。 SLAP 通过分布感知分层采样确保全面的数据分布覆盖,同时通过相对距离优化最大化批次内多样性。通过利用 Hessian 近似梯度信息进行动态批量选择,SLAP 在多个模型架构(LLaMA、ChatGLM)和各种下游任务(包括多轮对话、多语言翻译和问答)中显着优于现有的最先进方法。最值得注意的是,与完整数据集训练相比,SLAP 通过减少 20-40% 的训练数据实现了卓越的性能,从而在保持或提高模型能力的同时大幅降低了计算成本。这些结果表明 SLAP 是一种高效且有效的 大语言模型 指令调整的强大方法。