论文

日志异常检测:比较大模型适配、成本与鲁棒性

Towards Understanding LLM-Based Log Anomaly Detection: An Empirical Study of Performance, Efficiency, and Robustness

模型评测模型能力评测

摘要

大型语言模型(LLM)在日志异常检测方面表现出了良好的性能,但其适应策略、架构和部署配置如何影响检测有效性仍不清楚。为了研究这些因素,我们对三个公共日志数据集进行了系统的实证分析,检查不同的适应策略、模型架构、参数尺度和量化设置。我们的结果揭示了不同适应策略的显着性能差异,而模型缩放在不同数据集中产生不同的检测增益。我们进一步观察到,具有相当检测精度的模型可以表现出明显不同的计算成本,并且低位量化在很大程度上保留了评估配置中的检测性能。最后,我们检查了不同扰动级别的结构、语义和标签噪声下的检测鲁棒性。这些发现为基于 LLM 的日志异常检测的性能、效率和鲁棒性提供了实证见解,强调了传统的以准确性为导向的评估之外的实际考虑因素。

日志异常检测评测框架,覆盖性能、推理与适配效率、部署、量化和噪声鲁棒性。
图1(图注摘要):日志异常检测评测框架,覆盖性能、推理与适配效率、部署、量化和噪声鲁棒性。