论文

LLM-增强型日志异常检测:大语言模型 用于自动化系统诊断的综合基准

LLM-Enhanced Log Anomaly Detection: A Comprehensive Benchmark of Large Language Models for Automated System Diagnostics

模型评测模型能力评测

摘要

系统日志异常检测对于维护大型软件系统的可靠性至关重要,但传统方法难以应对现代日志数据的异构性和不断发展的性质。 大语言模型 (LLM) 的最新进展为日志理解提供了有前途的新方法,但仍然缺乏基于 LLM 的方法与现有技术的系统比较。在本文中,我们提出了一项全面的基准研究,评估了四个广泛使用的公共数据集(HDFS、BGL、Thunderbird 和 Spirit)中基于 LLM 和传统的日志异常检测方法。我们评估了三类方法:(1) 与机器学习分类器相结合的经典日志解析器(Drain、Spell、AEL),(2) 微调的 Transformer 模型(BERT、RoBERTa),以及(3)零样本和少样本设置中基于提示的 LLM 方法(GPT-3.5、GPT-4、LLaMA-3)。我们的实验表明,虽然经过微调的 Transformer 实现了最高的 F1 分数 (0.96-0.99),但基于提示的 LLM 表现出了卓越的零样本能力 (F1: 0.82-0.91),而无需任何标记的训练数据,这对于标记异常稀缺的实际部署来说是一个显着的优势。我们进一步分析了每种方法的成本与准确性权衡、延迟特征和故障模式。我们的研究结果为从业者根据其在准确性、延迟、成本和标签可用性方面的具体限制选择日志异常检测方法提供了可行的指南。所有代码和实验配置都是公开的,以促进可重复性。