论文

了解并缓解 LLM 生成的代码中与库相关的问题

Understanding and Mitigating Library-Related Issues in LLM-Generated Code

智能体系统Agent Harness

摘要

软件从业者越来越依赖大语言模型(LLM)来生成集成外部库的代码。然而,LLM 经常会产生不正确的库使用,例如无效的导入、过时的 API 调用和幻觉的依赖关系,导致编译或运行时失败,从而降低人工智能辅助软件开发的可靠性。在本文中,我们提出了一种 Agentic 方法来减少 LLM 生成的代码中与库相关的错误。更具体地说,我们首先进行了一项探索性研究,以描述大语言模型产生的与图书馆相关的问题。我们对 100 个 LLM 生成的代码文件的分析表明,84% 的生成文件至少包含一个与库相关的错误,重复出现的模式包括不正确的导入路径、缺失导入、幻觉库、已弃用的库使用和未使用的导入。基于这些发现,我们设计了一种 Agentic 方法,该方法集成了任务分析、文档基础、代码生成和自动验证,以改善代码合成期间的库使用。我们在 300 个代码生成任务上评估了我们的方法,这些任务源自快速发展的 Python 框架(包括 LangChain 和 AutoGen)的实际实现,涵盖五个 LLM:GPT-5、DeepSeek-V3、Qwen3、Mistral 和 Llama 3。结果表明,我们的方法持续提高了所有评估模型的代码生成质量,将库相关错误减少了 38.1% - 54.6%,并将代码正确性提高了 16%。