论文

对本地部署的 LLM 用于 Python 代码中错误检测的实证评估

An Empirical Evaluation of Locally Deployed LLMs for Bug Detection in Python Code

模型评测模型能力评测

摘要

大语言模型 (LLM) 在广泛的软件工程任务(包括代码生成和分析)中表现出了强大的性能。然而,大多数先前的工作依赖于基于云的模型或专用硬件,限制了在隐私敏感或资源受限的环境中的实际适用性。在本文中,我们对两个本地部署的 LLM、LLaMA 3.2 和 Mistral 进行了系统的实证评估,以使用 BugsInPy 基准进行实际 Python 错误检测。我们使用功能级别的零样本提示方法和基于关键字的自动化评估框架评估了 17 个项目的 349 个错误。我们的结果表明,本地执行的模型的准确度在 43% 到 45% 之间,同时产生很大一部分部分正确的响应,这些响应可以识别有问题的代码区域,但无法指出确切的修复方法。不同项目的性能差异很大,凸显了代码库特征的重要性。结果表明,本地模型可以识别有意义的 bug,但对于本地执行的 LLM 来说,精确定位仍然很困难,特别是在实际开发场景中处理复杂且依赖于上下文的 bug 时。