论文

FrenchNews-7:法国新闻编辑台分类跨出版商基准测试

FrenchNews-7: Benchmarking Cross-Publisher French News Editorial Desk Classification

模型评测基准与评测资源

摘要

我们推出 FrenchNews-7,这是一个位于法国的跨出版商法语新闻编辑台分类基准,结合了大型多渠道语料库、源自 URL 的七类分类法和微调的 CamemBERT 分类器。标签是通过混合管道分配的,该管道将发布者 URL slugs 与结构不明确的情况下的 LLM 注释相结合,并通过评估者间研究进行审核(2 个人 + 2 LLM;成对 $κ\geq 0.766$,人类--人类 $κ= 0.806$)。我们在发行中和保留的出版商设置下评估词汇、多语言和法语特定的训练分类器,并与保留池上的零样本 LLM 基线(GPT-OSS-120B、Mistral Small 3.2、Llama-3.3-70B)进行额外比较。最强的模型基于完整文章文本的 CamemBERT,优于仅标题输入,泛化到看不见的媒体,并且在整体召回率上超过了所有三个零样本 LLM 基线 (0.799),差距集中在模糊的编辑边界类别 Economie 和 Societe 中。跨出版商评估揭示了不均匀的边界稳定性:Sport、Culture & Loisirs 和 International 传输干净,而 Economie(召回率 = 0.517)接近盲态人类协议(0.55),而 Societe(精度 = 0.577)吸收了边界模糊性,两者都表明编辑惯例而不是可恢复的分类器净空。微调的 CamemBERT-base 模型、标记清单、参考收集脚本和可靠性层指导表可在 https://huggingface.co/LeFrenchNewsLab/camembert-base-frenchnews7(模型)和 https://huggingface.co/datasets/LeFrenchNewsLab/frenchnews-7(数据集)中获取。