论文

LLM 生成的错误报告摘要中幻觉的实证分析和检测

Empirical Analysis and Detection of Hallucinations in LLM-Generated Bug Report Summaries

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 越来越多地用于生成软件错误报告摘要,包括重现步骤 (S2R)、实际行为 (AB) 和预期行为 (EB) 等部分。然而,这些模型经常产生令人信服但没有来源报告支持的幻觉。这可能会误导开发人员并降低对自动化维护工具的信任。现有的幻觉检测方法通常评估全响应级别的输出,并且不考虑技术文档的结构。对 80 个结构化错误报告摘要的初步探索性研究发现,大约 47.9% 包含缺失信息,而 12.3% 包含捏造内容,这凸显了错误报告摘要中系统幻觉分析的必要性。在这项工作中,我们从分段感知的角度实证研究 LLM 生成的错误报告摘要中的幻觉。使用源自 Mozilla OSS 项目的 BugsRepo 数据集,我们引入受控合成幻觉注入来构建训练和评估的基准。我们提出了一种分段感知幻觉检测方法,该方法共同预测摘要是否包含幻觉内容、识别受影响的部分并对幻觉类型进行分类。多个预训练语言模型的实验结果表明,所提出的方法在所有任务中都取得了很强的性能,最佳模型获得了 0.89 报告级 Macro-F1、0.83 节级 Macro-F1 和 0.84 幻觉型 Macro-F1。我们进一步分析常见的幻觉模式和模型故障模式,以更好地理解当前 LLM 生成的错误报告摘要的局限性。研究结果强调了分段感知幻觉分析对于提高软件维护工作流程中 LLM 辅助错误报告摘要的可靠性的重要性。