论文

Fine PT-PT Web:欧洲葡萄牙网高质量410亿词元数据采集

Fine PT-PT Web: A High-Quality 41 Billion Tokens Data Collection of the European Portuguese Web

AI 基础设施数据基础设施

摘要

针对欧洲葡萄牙语 (PT-PT) 等区域语言变体的网络语料库的管理受到方言重叠(主要是 PT-BR)和数据处理规模的严重瓶颈。本文提出了一种高效的管道,用于从葡萄牙语网络中管理可用于生产的 PT-PT 语料库,涵盖来自 Arquivo.pt 的 411 TB 原始数据。我们引入了一种新颖的后抓取块,可以在过滤之前删除样板和行重复项。这种早期干预通过挽救标准启发式过滤器过早丢弃的有效文本,将最终文档产量提高了 19.04%。我们的管道与严格的语言识别、加权模糊重复数据删除和神经质量分类相结合,提供了一个可扩展的框架和一个针对 LLM 预训练 优化的干净、有代表性的语料库。