论文
通过采样的 BPE 词元统计数据审计中国网络规模的语料库
Auditing Chinese Web-scale Corpora via Sampled BPE Token Statistics
摘要
LLM中出现中文网络污染,引发了对上游中文语料库的审计。然而,审计此类语料库面临三个挑战:(1)它们的网络规模大小使得全面扫描成本高昂; (2) 先前的分析往往过于粗略,无法暴露 词元级 污染; (3)中国网络污染是隐性的、快速变化的。我们提出了 Sampled-BPE,这是一个轻量级的 词元级 审计管道,它对一小部分子集进行采样并训练 BPE 标记器以显示污染的标记。实验表明,Sampled-BPE 保留了可用的估计值,同时大大减少了运行时间和内存:148.4 $\times$ 加速和 35.8 $\times$ 内存减少仅导致污染类别的相对误差为 4.25%。我们将该管道应用于 2021 年至 2026 年的 11 个开放中文语料库和 6 个中文 Common Crawl 快照。审计揭示了开放语料库中广泛但不均匀的污染,以及高度污染和暂时变化的中文网络内容。我们进一步发布了一个分层的中文网络词元数据集,其中包含 66 万多个词元记录,每个词元记录都有网络上下文、类别和解释字段,以树的形式组织以支持污染的审查和追踪。