论文
人类书写文本中事实错误的实证分析及其在事实错误检测中的应用
An Empirical Analysis of Factual Errors in Human-Written Text and Its Application to Factual Error Detection
摘要
事实错误检测(FED)是识别给定文本中事实上不正确的跨度的任务,长期以来一直被认为是一个重要的研究问题。然而,随着 大语言模型 (LLM) 的迅速崛起,研究注意力已转向 LLM 生成的文本(幻觉)特有的事实错误及其检测。因此,人类书写文本中事实错误的检测相对被忽视了。为了解决这一差距,我们首先通过分析报纸文章的更正,提炼出人为事实错误的分类法,报纸文章是保证由人类编写且几乎不包含语法错误的代表性文本来源。我们的分析表明,存在汉字错误转换和单位错误等特征类别,这些特征类别并未在现有的幻觉基准中得到关注。然后,根据分类法,我们在综合的实际测试用例和实际校正上评估普通 LLM 的 FED 能力。实验结果表明,即使是 GPT-5.4 等高性能 LLM 在综合评估数据上也只能获得 52% 的字级 F1 分数,凸显了任务难度。此外,通过检测难度进行详细分析,揭示了FED的现状。