论文
HelaBERT:用双池化分类头增强僧伽罗语理解
HelaBERT: Enhancing Sinhala Language Understanding with Dual Pooling Classification Head
摘要
HelaBERT包含两个从零预训练的BERT掩码语言模型,使用约10亿僧伽罗语词元,来自MADLAD-400、CulturaX以及新闻、僧伽罗语维基百科和网页抓取组成的自建语料。小模型约2330万参数、6层,大模型约1.1亿参数、12层,均使用适配僧伽罗语黏着形态与复杂文字的SentencePiece Unigram分词器,词表大小为32000。研究在新闻类别、新闻来源、情感和写作风格四项分类任务中评估,采用分层80/20训练测试划分及五次独立随机种子运行。新增双池化分类头在情感分析上持续改善,小模型的新闻类别分类也取得一定增益;平均输入较短的标题级新闻来源任务中,标准[CLS]线性分类头仍有竞争力。两个模型均已发布,用于支持僧伽罗语自然语言处理研究。