论文
Web 增强 LLM 代码生成中搜索引发的问题:检测和修复引发错误的页面
Search-Induced Issues in Web-Augmented LLM Code Generation: Detecting and Repairing Error-Inducing Pages
摘要
Web 增强的 大语言模型 (LLM) 提供了有前景的自动代码生成功能。然而,集成实时网络搜索会使模型暴露于不可靠或恶意内容,从而导致搜索引发的问题(SII),这是一种新颖的故障模式,外部页面会误导 LLM 生成错误的代码。本文对三个商业搜索 API 和六个高级 LLM 中 SII 的普遍性和影响进行了全面的实证研究。我们的分析表明,所有经过评估的网络增强 LLM 都容易受到 SII 的影响,根本原因是搜索到的错误诱导页面 (EIP) 中的规范不一致或代码实现有缺陷。为了应对这一挑战,我们提出了 Sherlock,这是一个自动化框架,使 LLM 服务提供商能够主动大规模地保护网络增强生成系统。 Sherlock 作为一个连续管道运行,首先检测潜在的 SII 实例,然后对其进行调试以识别负责任的 EIP 并查明其根本原因,最后通过注释未对齐的内容或使用来自可信来源的评估解决方案替换错误的代码片段来修复它们。实验表明,Sherlock 识别出 F1 分数高达 95% 的 EIP,并在评估模型中修复了 71% 至 100% 的受影响代,且计算开销适中。我们的研究结果和框架为提高现实软件工程场景中基于网络增强的 LLM 的代码生成系统的可靠性提供了实用指导。