论文
TAILOR:长尾日志解析的模板保留增强
TAILOR: Template-Preserving Augmentation for Long-Tailed Log Parsing
摘要
日志解析对于系统日志分析至关重要,因为它通过将非结构化日志消息转换为结构化日志模板来支持调试、监控和异常检测等任务。然而,现实世界的日志数据集表现出高度不平衡的长尾分布,其中少量频繁模板占主导地位,而许多稀有模板仅出现几次。这种不平衡导致评估结果过于乐观,因为允许频繁的模板主导基准指标,而罕见但操作上重要的事件的不良性能仍然在很大程度上被隐藏。在本文中,我们研究了稀有日志组(定义为实例少于五个的日志组)的普遍性和影响。我们对广泛使用的 Loghub-2.0 基准的实证研究表明,稀有日志组占所有模板的近 20%,但不到日志消息的 0.01%。因为它们只包含少数实例,所以所有评估的解析器在这些组上都会经历显着的性能下降。为了应对这一挑战,我们提出了 TAILOR,这是一个日志解析框架,可通过模板保留增强来改进罕见日志组的模板推理。 TAILOR 在模板推断之前使用模板一致的日志消息来丰富罕见的日志组。额外的结构证据有助于区分静态标记和动态变量。我们的实验结果表明,TAILOR 将稀有日志组的解析精度比最强基线提高了 19%,同时保持了完整数据集上的竞争性能。我们进一步表明,所提出的增强策略可以推广到不同的 LLM 主干,并持续改进现有的基于 LLM 的解析器,而无需修改其核心架构。