论文
Wieszcz-XIX:1918年前波兰语语料与限定时代的语言模型
Wieszcz-XIX: A 3.1-Billion-Word Corpus of Pre-1918 Polish and Temporally Bounded Language Models Trained From Scratch
摘要
历史波兰语的语言记录丰富,但本文涉及时期的机器可读标注仅约一百万词,其余资料依赖质量不一的OCR。我们发布Wieszcz-XIX:包含67.5亿token、约31亿词和294,369份文档的1800—1918年波兰语语料,多数文档为期刊期次。语料来自Wolne Lektury和Internet Archive,经筛选、去重、1918年后内容泄漏审计,并按文档划分。它比同时期标注语料大三个数量级以上。我们量化了识别损坏,并参照误报底线衡量;移除了近乎相同的重复文档;排除训练语料中的1918年后泄漏,但转录源内仍存在已知残留,占字节数的0.04%—0.38%。发布语料与实际训练语料逐文档相同。在人工校正样本中,可辨认文本的字符错误率为0.68%,45%的抽样段落无法校正。我们从零训练了4700万至3.49亿参数的仅解码器模型,并测量其时代边界。相较两个现代波兰语基础模型——其中一个规模大得多——3.49亿参数模型出现性能交叉,1.07亿参数模型相较同规模对照也如此:1918年后的词汇比当时词汇每字节约多需3.1比特,而对照模型未显示这一差距;当时词汇所需比特又少于对照模型。给定当时文本,模型能保留原拼写,对照模型仅部分保留。增加参数带来的收益约为再次遍历数据的两倍。我们发布语料、代码与权重。内容提示:模型会再现当时的偏见,包括反犹太言论。