论文
基准测试是否低估了 LLM 性能?使用 LLM 评估幻觉检测 - 首先由人类判定的评估
Do Benchmarks Underestimate LLM Performance? Evaluating Hallucination Detection With LLM-First Human-Adjudicated Assessment
摘要
幻觉仍然是 大语言模型 (LLM) 中持续存在的挑战,特别是在 RAG 和代理 AI 系统等基于上下文的环境中。本研究重点关注摘要任务中的情境幻觉检测。我们通过将原始基准注释与 Gemini 2.5 Flash 和 GPT-5 Mini 的推理和基于跨度的预测进行比较来分析 QAGS-C 和 SummEval 数据集。为了解决人类标签和 LLM 判断之间的系统性差异,我们通过涉及 2 名跨文化裁决者的人类裁决过程重新评估了所有冲突样本。重新评估后,QAGS-C 的三重一致性(人类、GPT 和 Gemini 之间)增加了 6.38%,SummEval 增加了 7.62%。同样,模型准确性也有所提高,GPT 在 QAGS-C 上提高了 4.25%,在 SummEval 上提高了 2.34%,而 Gemini 分别提高了 8.51% 和 3.80%。值得注意的是,当 LLM 提供明确的推理时,评审者经常支持模型对原始人类注释的判断。人类评审员的总体一致性在 83% 到 87% 之间。这些发现表明,对于容易出现歧义的任务,单遍注释可能不够,模型辅助的重新评估可以产生更可靠的基准。