论文
有智:通过自适应 GQA 到 MLA 过渡迈向高并发金融 LLM
YouZhi: Towards High-Concurrency Financial LLMs via Adaptive GQA-to-MLA Transition
摘要
大语言模型 (LLM) 推动了重大的金融创新,但其高并发部署受到 KV 缓存内存开销的严重瓶颈,从而增加了基础设施成本并限制了可扩展性。为了解决这个问题,我们提出了YouZhi-LLM,这是一种高效的金融LLM,由华为Ascend生态系统原生构建的全面结构转型和训练管道提供支持。在其算法核心,YouZhi-LLM 具有层自适应 GQA 到 MLA 转换框架,该框架动态分配每层 FreqFold 大小,最大限度地提高 KV 缓存压缩,同时最大限度地减少困惑度下降。为了恢复代表能力并注入领域专业知识,基于 Ascend 的训练管道将广义 知识蒸馏 与金融特定的监督 微调 无缝集成。评估证明了这种系统方法的优越性,与统一基线相比,自适应过渡将困惑度下降降低了高达 35%。至关重要的是,当通过 vLLM-Ascend 在 Ascend NPU 上进行评估时,大量 KV 缓存减少会直接转化为部署效率。与各自的基础模型相比,YouZhi-7B 的平均财务基准分数提高了 12.3%,最大并发度提高了 2.69$\times$;同样,YouZhi-14B 实现了 7.0% 的准确率提升和 2.43$\times$ 的并发性提升,为经济高效、高吞吐量的金融推理建立了新的范式。