论文

99% 的准确度衡量什么?对广泛使用的假新闻语料库中快捷学习的可重复审核

What Does 99% Accuracy Measure? A Reproducible Audit of Shortcut Learning in a Widely Used Fake News Corpus

模型评测鲁棒性、公平性与可信度评测

摘要

在 ISOT/Kaggle“假新闻和真实新闻”语料库上训练的文本分类器通常会报告准确性和 F1 高于 0.98,这一性能水平与评估准确性的难度相比令人不安。使用透明的 TF-IDF 和线性分类器管道作为测量工具,我们沿着三个泄漏通道和两个分布转移协议审核语料库,释放所有代码和派生数字。首先,基准是部分退化的:仅给出主题元数据字段并丢弃文章文本的分类器达到 F1 = 1.000,因为两个类具有不相交的主题。其次,删除所有三个泄漏渠道、元数据、99.2% 真实文章中存在的新闻专线来源标签以及污染 19.4% 的原始测试拆分的 6,251 个重复文档,仅将 F1 降低 1.21 个点(0.9935 至 0.9814);残余信号是分散的编辑风格,而不是一些赠品标记,因为删除 1,000 个最高权重的一元组仍然留下 F1 = 0.926。第三,这种风格的信号不会转移:在主题不相交的协议下,平均精度从 0.9995 下降到 0.9475,部署 F1 从 0.9905 到 0.8067,先前的匹配分析确认了真正的 5.2 点辨别力损失,而时间转移几乎是无损的。经过微调的 DistilBERT 具有更强的分布性 (F1 = 0.9993),但在主题转移下性能下降得更多,与线性模型的 5.2 点相比,损失了 12.9 点平均精度。转移到独立的 LIAR 基准测试中,所有三个模型均落入接近机会排名(ROC-AUC 0.54-0.57),没有一个模型超过多数类基线。我们得出的结论是,这里的语料库内分数量化了源和主题的可分离性,而不是准确性,增加的容量利用了捷径而不是避免它,并且我们建议仅元数据、小样本和主题不相交的基线作为未来工作的廉价诊断。