论文

面向顶级HPC系统非结构化日志解析与挖掘的指令微调LLM

Instruction-Tuned LLMs for Parsing and Mining Unstructured Logs on Leadership HPC Systems

模型训练监督微调与指令调优

摘要

顶级HPC系统产生海量异构且大多非结构化的系统日志。由于这些日志源自多样的软件、硬件与运行时层,其格式不一致,使结构抽取与模式发现极具挑战性。因此,稳健的日志解析与挖掘对于将这些原始遥测数据转化为可操作的洞见至关重要,这些洞见可揭示运行模式、诊断异常,并支持可靠、高效、可扩展的系统分析。大语言模型(LLM)的最新进展为顶级HPC环境中的自动化日志理解提供了有前景的新方向。为把握这一机遇,我们提出一个领域适配、遵循指令、LLM驱动的框架,利用思维链(CoT)推理以高保真度解析并结构化HPC日志。我们的方法将领域特定的日志模板数据与指令微调样本相结合,微调出一个面向HPC日志分析的8B参数LLaMA模型。我们开发了一种混合微调方法学,将通用LLM适配到领域特定日志数据,实现了保护隐私、可本地部署、快速且节能的日志挖掘途径。我们在来自LogHub仓库的多样化日志数据集上进行实验。评估证实,我们的方法取得了与显著更大的模型(如LLaMA 70B与Anthropic的Claude)相当的解析准确率。我们进一步通过在四周窗口内解析Frontier超级计算机超过6亿条生产日志来验证微调后LLM模型的实用价值,揭示了时间动态、节点级异常以及工作负载-错误日志相关性中的关键模式。

面向顶级HPC系统非结构化日志解析与挖掘的指令微调LLM:论文配图
图 3:日志解析任务的图示。给定一组原始日志行,目标是提取它们的底层模式,称为日志模板。我们建议利用遵循指令的LLM来实现这一目标。