论文

利用语言模型在多语言场景中生成日志语句:我们还有多远?

Leveraging Language Models for Log Statement Generation in Multilingual Scenarios: How Far Are We?

模型评测基准与评测资源

摘要

日志语句捕获软件维护活动的关键信息,例如测试、调试和故障分析。由于这种重要性,开发人员必须仔细设计日志语句,这需要付出巨大的努力。为了支持开发人员,已经提出了各种端到端自动日志语句生成方法,而这些方法主要在单一编程语言环境中进行评估,并且它们在多语言环境中的有效性仍未得到充分探索。因此,在本文中,我们跨多种编程语言比较评估了三种最先进的日志语句生成方法和五种 大语言模型 (LLM)。为此,我们构建了一个多语言基准测试,其中包含五种编程语言的 150,000 个实例。我们的实证结果表明,UniLog 这种最先进的方法能够实现最佳的整体性能,即使在多语言环境中也能保持较高的有效性。我们还观察到不同语言的日志生成难度存在很大差异:Python 提出了更大的挑战,而 JavaScript 产生了相对更好的性能。详细分析表明,这些差异源于日志插入分布和特定语言的日志习惯用法的变化。我们的研究结果表明,简单地缩放模型大小或训练数据量不足以生成多语言日志;相反,针对目标语言的具体特征设计方法至关重要。这些发现表明,未来的自动日志记录技术应明确考虑特定于语言的日志记录特征,以在多语言软件开发环境中实现稳健的性能。