论文

当LLM发明铁锈箱时:幻觉模式及其缓解的实证研究

When LLMs Invent Rust Crates: An Empirical Study of Hallucination Patterns and Mitigation

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 已经成为代码生成的强大工具,但它们仍然容易产生幻觉$\unicode{x2013}$产生看似合理但不正确或捏造的输出。其中,包幻觉(LLM 暗示不存在的依赖关系)给软件供应链带来了新的安全风险。虽然之前的研究主要集中在 Python 或 JavaScript 等流行语言上,但在这项工作中,我们首次对 LLM 生成的 Rust 代码中的板条箱幻觉进行了大规模实证研究。我们构建了一个多源数据集,结合了来自 Stack Overflow、GitHub 的编码任务和 LLM 生成的任务,并在各种解码设置下评估商业和开源模型。我们的分析表明,与之前在 Python 和 JavaScript 中的发现不同,Rust 中的幻觉行为遵循一种独特的模式:不同的模型表现出令人惊讶的一致幻觉率,并且这些率对模型参数表现出最小的敏感性。此外,我们研究了即时工程策略,以在不牺牲代码质量的情况下减轻幻觉。这项研究为 LLM 辅助 Rust 开发的可靠性和安全性影响提供了新的见解,为软件工程工作流程中的未来研究和更安全的模型部署提供了指导。