论文

超越文档证据依赖:对代码、工具输出和文档的文本片段级幻觉检测

Beyond Document Grounding: Span-Level Hallucination Detection over Code, Tool Output, and Documents

模型评测基准与评测资源

摘要

检索增强生成(RAG)的幻觉检测通常根据自然语言文档证据进行评估。然而,基于证据的生成系统越来越依赖结构化输入:源代码、开发人员工具输出、Markdown 文档、表格和存储库元数据。我们引入了针对代码、工具输出、结构化文档和现有自然语言 RAG 数据集的跨级幻觉检测的统一基准。该基准的建立是从有依据的正确答案开始,注入带有精确字符标签的局部幻觉,并通过基于证据的审查来验证代码测试分割。我们经过微调的 Qwen3.5-2B 检测器在统一测试集上达到 0.689 span-F1,在代码代理源上达到 0.60,其性能大大优于 LettuceDetect-large (0.17) 和我们评估的最强零样本 LLM 判断器(最多 0.22)。同一模型在既定的自然语言基准上仍然具有竞争力,RAGTruth 示例 F1 为 81.8,英语 PsiloQA IoU 为 0.724。