论文
Delulu:经过验证的多语言基准,用于填空任务中的代码幻觉检测
Delulu: A Verified Multi-Lingual Benchmark for Code Hallucination Detection in Fill-in-the-Middle Tasks
摘要
用于代码生成的 大语言模型 经常在中间填充 (FIM) 任务中产生幻觉——看似合理但不正确的完成,例如发明的 API 方法、无效参数、未定义的变量或不存在的导入。这些失败通过了肤浅的审查,但却引入了运行时错误。我们推出 Delulu,这是一个经过验证的多语言基准,包含 7 种语言和 4 种幻觉类型的 1,951 个 FIM 样本。样本通过对抗性管道进行管理:前沿 LLM 生成似是而非的幻觉,四种不同的判断模型对其进行评估,基于嵌入的聚类挖掘逐渐困难的示例,自包含的 Docker 容器验证黄金完成编译,而幻觉变体产生预期的运行时错误,最终的人类专家审查删除了任何剩余的有偏见或微不足道的可判定样本。我们评估了来自 5 个系列的 11 个开放权重 FIM 模型,涵盖 0.5B-32B 参数:一个六点 Qwen2.5-Coder 缩放板,加上一个跨系列板(CodeLlama、DeepSeek-Coder-V2、StarCoder2)。最强的模型仅达到 84.5% pass@1,没有一个家族超过 0.77 编辑相似度,并且每个家族都在相当大的样本份额上产生了幻觉对齐的完成,这证实了 Delulu 暴露的困难是任务固有的,而不是家族特定的。我们在 https://github.com/microsoft/delulu 发布了基准测试、容器和评估框架。