论文
应对 NeurIPS 2023 LLM 效率挑战的 nextAI 解决方案
The nextAI Solution to the NeurIPS 2023 LLM Efficiency Challenge
摘要
大语言模型 (LLM) 的快速发展对自然语言处理领域产生了重大影响,但其日益增长的复杂性引发了对资源使用和透明度的担忧。为了应对这些挑战,我们参加了 NeurIPS LLM 效率挑战赛,旨在在严格的约束下微调基础模型。我们的重点是 LLaMa2 700 亿模型,在 24 小时限制内在单个 A100 40GB GPU 上进行了优化。我们的方法取决于自定义数据集,该数据集由不同的开源资源和基准测试精心组装而成,与挑战赛的开源精神保持一致。我们的方法利用了量化低秩适应 (QLoRA) 微调,与 Flash Attention 2 等先进的注意力机制集成。我们尝试了 LoRA 技术的各种配置,优化了计算效率和模型精度之间的平衡。我们的 微调 策略以多个数据集组合的创建和迭代测试为基础,从而选择了在不同任务和基准测试中表现出稳健性能的版本。我们努力的成果是高效微调的 LLaMa2 70B 模型,该模型在单个 GPU 的限制下运行,不仅显着降低了资源利用率,而且在一系列 QA 基准测试中也实现了高精度。我们的研究证明了在资源有限的环境中优化大型模型的可行性,强调了 LLM 在实际应用中的潜力。