论文

自动记录是语言敏感的:LLM 的多语言基准和实证研究

Automated Logging Is Language-Sensitive: A Multilingual Benchmark and Empirical Study of LLMs

模型评测基准与评测资源

摘要

日志语句对于调试、故障诊断和生产可观察性至关重要,但编写日志语句需要开发人员决定在哪里放置日志语句、使用哪个 API 和严重性级别以及要公开哪些运行时信息。自动日志记录旨在减轻这种负担,但现有证据仍然以 Java 为中心的存储库快照数据集为主。因此,尚不清楚关于模型行为和模型选择的结论是否可以在编程语言生态系统或现实代码演化中推广。本文介绍了 MultiLogBench,这是一种跨越六种编程语言生态系统的多语言基准和实证研究。 MultiLogBench 包含 63,965 个生产代码存储库快照实例、744 个修订历史记录案例(开发人员在维护期间引入日志语句)以及一对用于稳健性分析的转换修订历史记录分支。我们使用统一协议下的七个当代 大语言模型,评估测井站点定位、框架锚匹配、严重性预测、消息生成、变量恢复和级联整体质量。结果显示出明显的跨语言变化:框架锚点匹配是对语言最敏感的组件,循环和嵌套可调用站点是最难的结构上下文,并且模型排名仅在顶层稳定。这些模式在修订历史数据上保持在粗略水平,而转换后的输入不会导致广泛的同向性能崩溃。总体而言,MultiLogBench 表明,有关自动日志记录的可靠声明需要多语言评估和面向维护的验证。