论文
FineWeb-CLaR:用于基准对齐语料库审核的文化、语言和区域注释
FineWeb-CLaR: Culture, Language, and Region Annotations for Benchmark-Aligned Corpus Auditing
摘要
语言模型的文化评估覆盖范围和稳健性很难诊断,因为预训练语料库和文化基准很少与可比较的元数据建立索引。基准越来越多地针对语言、地区和特定区域实践层面的文化现象,而网络规模的语料库通常仅按语言组织。共享的文化-语言-区域层使这些资源具有可比性,从而能够审核目标文化现象是否在预训练数据中得到体现、通过基准进行评估或两者兼而有之。为此,我们引入了 FineWeb-CLaR,这是一个源自 FineWeb 和 FineWeb-2 的大规模注释数据集,它将 Web 文档放置在共享的文化-语言-区域轴上,以进行语料库审核和基准对齐。 FineWeb-CLaR 使用源自 URL 的区域标签和文化主题来源来注释来自 FineWeb 和 FineWeb-2 的完整 30.9B 文档集合。我们的区域解析器将非空区域分配给 25.61% 的文档 (7.92B)。对于文化主题分析,我们引入了特定于地区的主题并将其投影到 Liu 等人的文化分类法的 14 个叶子上。 (2025),生成用于语料库端比较的区域设置主题分布 (LTD)。我们还使用相同的分类、语言覆盖范围和区域覆盖范围注释了 277 个文化 NLP 基准。这些资源共同实现了语料库端预训练证据和基准端评估覆盖范围之间的直接比较。