论文

HPC-LLM:用于 HPC 支持的实用域适应和检索增强生成

HPC-LLM: Practical Domain Adaptation and Retrieval-Augmented Generation for HPC Support

上下文与知识检索增强

摘要

现代科学研究越来越依赖于高性能计算 (HPC) 基础设施,但许多研究人员在与集群环境、作业调度程序、GPU 资源和并行计算框架交互时面临着巨大的操作障碍。通用 大语言模型 (LLM) 提供有用的编码帮助,但通常缺乏可靠 HPC 支持所需的特定领域操作知识。本文介绍了 HPC-LLM,这是一种检索增强和领域适应的助手,旨在支持常见的 HPC 工作流程,包括 Slurm 调度、MPI 执行、GPU 使用、文件系统管理和集群故障排除。所提出的框架集成了自动文档摄取、密集检索、使用 QLoRA 的轻量级域适应以及模块化编排管道中的本地推理。为了支持领域适应,我们根据公开的大学 HPC 文档、精选的操作示例以及从检索的 HPC 内容生成的合成指令-答案对构建了一个面向 HPC 的语料库。生成的数据集包含大约 9,000 到 24,000 个以 HPC 为中心的训练示例,涵盖作业调度、GPU 计算、分布式训练、存储系统和集群管理主题。我们使用 QLoRA 微调 Llama 3.1 8B,并根据 JetStream2 基础设施上的检索增强设置下的几个开放权重基线评估结果模型。实验结果表明,调整后的 8B 模型实现了与更大的通用模型相当的性能,同时在显着降低的 GPU 内存要求和推理延迟下运行。特别是,改编后的模型接近 Qwen 2.5 14B 的性能,同时需要的计算资源要少得多。