论文

LLM 能否检测微服务基础设施模式的实例?

Can an LLM Detect Instances of Microservice Infrastructure Patterns?

模型评测模型能力评测

摘要

架构模式经常出现在各种软件工件中。各种各样的模式及其实现使得当前工具的检测具有挑战性,特别是因为它们通常只支持检测以单一语言编写的工件中的模式。 大语言模型 (LLM) 经过各种软件工件和知识的培训,可能会克服现有方法的局限性。然而,它们的真正有效性和影响其性能的因素尚未得到彻底检验。为了更好地理解这一点,我们开发了 MicroPAD。该工具利用 GPT 5 nano 根据自然语言模式描述来识别以任何语言编写的软件工件中的架构模式。我们使用 MicroPAD 来评估 LLM 检测架构模式实例的能力,特别是与基础设施相关的微服务模式。为了实现这一目标,我们选择了一组 GitHub 存储库,并联系了他们的顶级贡献者,创建了一个新的人工注释数据集,其中包含 190 个包含微服务架构模式的存储库。结果表明,MicroPAD 能够检测多种语言和工件类型的模式实例。不同模式的检测性能各不相同(F1 分数范围为 0.09 到 0.70),特别是与它们的普遍性以及它们所表现出来的伪像的独特性有关。我们还发现,与可识别的、占主导地位的伪影相关的模式被更可靠地检测到。这些发现是否可以推广到其他 LLM 和工具是未来研究的一个有希望的方向。