论文

DeepParse:使用 LLM 合成的正则表达式掩码进行混合日志解析

DeepParse: Hybrid Log Parsing with LLM-Synthesized Regex Masks

AI 基础设施数据基础设施

摘要

现代分布式系统会产生大量异构日志,这对于可靠性、安全性和异常检测至关重要。由于不断变化的格式和有限的标记数据,将这些自由格式的消息转换为结构化模板(日志解析)具有挑战性。基于机器学习的解析器(例如 Drain)速度很快,但复杂变量的准确性通常会降低,而 大语言模型 (LLM) 提供更好的泛化能力,但会产生过高的推理成本。本文介绍了 DeepParse,这是一种混合框架,它使用 LLM 从小日志样本中自动挖掘可重用的变量模式,然后通过 Drain 算法确定性地应用它们。通过将推理阶段与执行阶段分开,DeepParse 可以实现准确、可扩展且经济高效的日志结构,而无需依赖脆弱的手工规则或每行神经推理。在 16 个基准数据集上,DeepParse 在变量提取方面实现了更高的准确度(平均解析准确度为 97.6%),并且比启发式基准和仅 LLM 基准更好的一致性。与启发式基线相比,将 DeepParse 集成到异常检测管道中可将误报减少 30% 以上,并将推理延迟减少 36%。