IHUBERT:波斯语资源的基于向量的语义去重和域平衡预训练
IHUBERT: Vector-Based Semantic Deduplication and Domain-Balanced Pretraining for Persian Resources
摘要
波斯语预训练语言模型 (PLM) 仍然受到大规模、高质量预训练语料库的稀缺以及标准分类和 NER 任务之外的评估不足的限制。我们推出了 IHUBERT,这是一种单语波斯语 PLM,使用基于 RoBERTa 的编码器(125M 参数)在 Sepahr-Danesh 集合的 45 GB 精选子集(约 7-8B 个词元)上从头开始训练。为了提高语料库质量并减少冗余,我们采用多阶段预处理管道,包括标准化、精确和近似重复删除、匿名化和基于矢量数据库的语义重复数据删除,以实现跨域和寄存器的分布平衡控制。我们还在完整的预训练语料库上训练了 139k 词汇量的 BPE 分词器,以更好地捕捉波斯语形态和拼写变化。 IHUBERT 使用任务标准指标(实体级 F1、Macro-F1、EM/F1)根据七个波斯 NLU 基准进行评估,涵盖 NER、情感分析、主题分类、NLI、提取式问答和关系提取。 IHUBERT 在提取 QA 方面取得了最大的进步,在 PQuAD (F1 88.3542) 和 ParsiNLU-RC (F1 49.0987) 上排名第一,并在 FarsTail (Macro-F1 0.8350) 上获得了最好的结果。在 NER 和主题分类方面,它仍然具有竞争力(例如,ParsTwiNER 上的 0.8308 F1;DigiMag 上的 0.7953 Macro-F1),而关系提取仍然是主要的剩余差距(PERLEX 上的 0.6684 Macro-F1)。 IHUBERT 预训练语料库上的受控分词器消融表明,在匹配的词汇量大小下,BPE 产生的子词碎片略低于 WordPiece,支持了我们的分词设计。总体而言,IHUBERT 通过语义策划的大规模预训练以及跨分类和面向理解的任务的广泛评估来推进波斯语建模。