论文
ErrEval:通过显式诊断实现的问题生成错误感知评估
ErrEval: Error-Aware Evaluation for Question Generation through Explicit Diagnostics
摘要
自动问题生成(QG)的产出常带有事实幻觉与答案不匹配等关键缺陷。然而,包括基于 LLM 的评估器在内的现有评估方法主要采用黑箱、整体式范式,缺乏显式的错误建模,导致此类缺陷被忽视、问题质量被高估。针对这一问题,我们提出 ErrEval,一个灵活的错误感知评估框架,通过显式错误诊断增强 QG 评估。具体而言,ErrEval 将评估重构为错误诊断随后知情评分的两阶段过程。在第一阶段,一个轻量、即插即用的错误标识器检测并归类结构、语言与内容方面的常见错误。这些诊断信号随后作为显式证据纳入,引导 LLM 评估器做出更细粒度、更有依据的判断。在三个基准上的大量实验证明了 ErrEval 的有效性,表明纳入显式诊断改善了与人类判断的一致性。进一步分析证实,ErrEval 有效缓解了对低质量问题的高估。
