论文

面向系统日志严重度分类的小语言模型与小推理语言模型基准评测

Benchmarking Small Language Models and Small Reasoning Language Models on System Log Severity Classification

模型评测模型能力评测

摘要

系统日志对监控和诊断现代计算基础设施至关重要,但其规模与复杂性要求可靠且高效的自动化解读。由于严重度级别是系统日志消息中预定义的元数据,让模型仅对其分类的独立实用价值有限,几乎无法揭示其解读系统日志的底层能力。我们主张,把严重度分类作为探测运行时日志理解的基准而非端任务,更具信息量。我们使用来自Linux生产服务器的真实journalctl数据,在零样本、少样本与检索增强生成(RAG)提示下评测九个小语言模型(SLM)与小推理语言模型(SRLM)。结果呈现强烈分层:Qwen3-4B在RAG下达到最高准确率95.64%;Gemma3-1B从少样本提示下的20.25%提升到RAG下的85.28%。值得注意的是,微小的Qwen3-0.6B在无检索时表现疲弱,却达到88.12%的准确率。相反,包括Qwen3-1.7B与DeepSeek-R1-Distill-Qwen-1.5B在内的若干SRLM在配合RAG时大幅退化。效率测量进一步区分了模型:多数Gemma与Llama变体每条日志推理用时不到1.2秒,而Phi-4-Mini-Reasoning每条超过228秒且准确率不足10%。这些发现表明,(1)架构设计、(2)训练目标与(3)在严格输出约束下整合检索上下文的能力共同决定性能。通过强调小型可部署模型,该基准契合数字孪生(DT)系统的实时需求,并表明严重度分类可作为评估模型能力与实时可部署性的透镜,对根因分析(RCA)与更广泛的DT集成具有意义。

面向系统日志严重度分类的小语言模型与小推理语言模型基准评测
图1:使用 SLM 与 SRLM 评估日志严重级别分类的工作流。系统日志从真实服务器收集,经提示策略(zero-shot、few-shot 以及使用 FAISS 的 RAG)处理,在多种开源模型上进行评估,并以准确率和推理速度衡量。