论文

用于检测和减轻代码库幻觉的静态分析方法的实证分析

An Empirical Analysis of Static Analysis Methods for Detection and Mitigation of Code Library Hallucinations

模型评测模型行为与机制分析

摘要

尽管进行了大量研究,大语言模型 在生成代码时仍然会产生幻觉,特别是在使用库时。在需要使用库的 NL 到代码基准测试中,我们发现 LLM 生成的代码在 8.1-40% 的响应中使用了不存在的库功能。检测和缓解幻觉的一种直观方法是静态分析。在本文中,我们分析了静态分析工具的潜力,包括它们可以解决什么问题和不能解决什么问题。我们发现静态分析工具可以检测 16-70% 的所有错误和 14-85% 的库幻觉,其性能因 LLM 和数据集而异。通过手动分析,我们确定了静态方法无法合理捕获的情况,这给出了其潜力的上限从 48.5% 到 77%。总的来说,我们表明静态分析方法是解决某些形式的幻觉的廉价方法,并且我们量化了它们距离解决问题还有多远。