论文

没有 GPU 可以走多远?跨问答、对话和总结的轻量级幻觉检测的系统基准

How Far Can You Get Without a GPU? A Systematic Benchmark of Lightweight Hallucination Detection Across Question Answering, Dialogue, and Summarisation

模型评测鲁棒性、公平性与可信度评测

摘要

幻觉检测已成为大规模部署值得信赖的人工智能的迫切要求。最准确的检测方法取决于 GPU 密集型推理、专有 API 调用或对生成模型的白盒访问。这使得资源有限的研究人员和从业者无法承受它们。在本文中,我们探索了一种实用的替代方案:仅使用基于公开可用模型构建的轻量级、CPU 可行的方法,幻觉检测的执行效果如何?我们系统地对五种这样的方法进行了基准测试:ROUGE-L、语义相似性、BERTScore、基于 FEVER 训练的 DeBERTa 模型的自然语言推理 (NLI) 检测器,以及相似性和 NLI 的分数级集成。我们在 HaluEval 基准的所有三项任务中对它们进行评估:问答 (QA)、对话和总结。我们在保留的验证拆分上校准每种方法,并在每个任务的 2,000 个测试实例上对其进行评估。我们发现没有单一方法占主导地位,并且性能高度依赖于任务。该集成在 QA 上表现最好(F1 = 0.792,AUC-ROC = 0.873),NLI 检测器在对话方面领先(AUC-ROC = 0.713),并且所有五种方法在摘要方面都退化为近随机性能(AUC-ROC 在 0.469 和 0.574 之间)。这种任务依赖性和总结上的系统性失败映射了无 GPU 幻觉检测的实际前沿。它们为计算限制下的方法选择提供了实用指导。所有实验都在使用公共模型的标准笔记本电脑 CPU 上运行。