论文

Naver-News-KO:摘要模型开源 微调 的韩国新闻摘要数据集

Naver-News-KO: A Korean News Summarization Dataset for Open-Source Fine-Tuning of Summarization Models

模型训练合成数据

摘要

我们发布了 Naver-News-KO,这是一个韩国新闻摘要数据集,包含 2022 年 7 月十天内从 Naver News 收集的 27,400 个(文档、摘要)对,涉及两个类别(经济和 IT/科学;77/23 分割),训练/验证/测试分区为 22,194 / 2,466 / 2,740,平均每条记录的文档到摘要字符压缩率为 6.03 倍。该数据集自 2023 年 1 月起在 Hugging Face Hub 上公开托管,截至 2026 年 5 月,每月下载量约为 33,000 次;社区维护的韩语摘要模型在其上进行了微调,包括 Gemma-2B-ko 和 Gemma2-9B 变体。该技术报告 (i) 记录了收集协议、列模式和拆分结构,(ii) 报告语料库级别的统计数据(长度分布、压缩比以及用户应注意的测试和训练之间测量的 16.8% 近乎重复的标题 Jaccard 重叠),(iii) 将资源与其他开放韩语摘要语料库进行对比,(iv) 提供 Lead-3 提取参考点(ROUGE-1 55.1、ROUGE-L) 50.6)和两个可重复的微调基线 - KoBART(R-1 56.6,BERTScore-F1 81.5)和带有 LoRA 的 Gemma-2B-ko(R-1 55.3,BERTScore-F1 78.3) - 以及发布时训练脚本,并且(v)澄清了资源的许可和预期使用范围。目标是为已经使用该数据集的下游工作提供可引用的参考,而不是提出新的基准。