论文

ErrEval:通过显式诊断实现的问题生成错误感知评估

ErrEval: Error-Aware Evaluation for Question Generation through Explicit Diagnostics

模型评测评测方法与指标

摘要

自动问题生成(QG)的产出常带有事实幻觉与答案不匹配等关键缺陷。然而,包括基于 LLM 的评估器在内的现有评估方法主要采用黑箱、整体式范式,缺乏显式的错误建模,导致此类缺陷被忽视、问题质量被高估。针对这一问题,我们提出 ErrEval,一个灵活的错误感知评估框架,通过显式错误诊断增强 QG 评估。具体而言,ErrEval 将评估重构为错误诊断随后知情评分的两阶段过程。在第一阶段,一个轻量、即插即用的错误标识器检测并归类结构、语言与内容方面的常见错误。这些诊断信号随后作为显式证据纳入,引导 LLM 评估器做出更细粒度、更有依据的判断。在三个基准上的大量实验证明了 ErrEval 的有效性,表明纳入显式诊断改善了与人类判断的一致性。进一步分析证实,ErrEval 有效缓解了对低质量问题的高估。

ErrEval:通过显式诊断实现的问题生成错误感知评估
图3:ErrEval 框架。给定文段(p p)、答案(a a)、生成的问题(q q)与评估标准(c c),ErrEval 执行带显式错误诊断的评估。迭代训练的 Error Identifier(EI)检测错误类型(e l el),并将其组织为诊断信息(e r r err),用于指导 LLM 评估器进行维度特定的打分。EI 作为轻量级、即插即用的模块运行。