论文

大语言模型 中特定领域的幻觉检测

Domain-Specific Hallucination Detection in Large Language Models

模型推理推理验证与自校正

摘要

大语言模型 生成流畅的文本,其中可能包含不忠实的声明——这种现象称为幻觉。我们提出了一种多信号检测管道,结合了微调的 DeBERTa-v3 分类、蒙特卡罗 (MC) Dropout 不确定性量化和用于响应级幻觉检测的温度标度校准。在 HaluEval 基准上进行评估,我们的流程在通用域任务上实现了 F1=0.915 和 AUROC=0.977,每个任务的 F1 分数为 0.97(QA)、0.96(总结)和 0.82(对话)。 MC Dropout 推理进一步将准确率提高到 93.2%。上下文消融研究证实该模型执行真正的蕴涵推理,而不是利用表面模式,当知识上下文被删除时,摘要 F1 下降了 24%。学习曲线分析表明,25% 的训练数据捕获了 77% 的全数据性能。除了检测之外,我们还将直接偏好优化 (DPO) 应用于 Qwen2.5-0.5B 发生器,根据我们的检测器测量,其幻觉率从 85.5% 降低到 37.7%(相对降低 55.9%)。 SciFact 生物医学基准的跨领域评估表明,通用领域训练迁移很差 (F1=0.52),从而激发了特定领域的 微调。 PubMedBERT 在 SciFact 上进行微调,达到 F1=0.63 和 AUROC=0.81,证明域匹配的 预训练 是最强的适应策略。代码和模型可在 https://github.com/varunteja99/hallucination-detection-nlp 获取