论文

从零到英雄:亚美尼亚开放的 LLM 生态系统

From Zero to Hero: An Open LLM Ecosystem for Armenian

模型训练预训练

摘要

亚美尼亚语是一种形态丰富且资源匮乏的语言,其预训练数据很稀缺,并且尚未发布开放的亚美尼亚语 LLM 以及重现它所需的数据和配方。为了解决这一差距,我们策划并发布了两个数据集。 ArmWeb 是一个经过广泛验证的语料库,包含 437 万条亚美尼亚新闻文档。 ArmSTEM 是一个平行的英语-亚美尼亚语集合,包含 373K 数学和科学问题,并提供分步解决方案,已翻译成亚美尼亚语,并通过保留答案的 LLM 判断和人工评估进行验证。在这些数据集上继续对 Gemma-4-E4B 进行预训练会产生 arm-gemma-e4b,它的性能优于所有现有的开放亚美尼亚模型及其未适应的基础,并且是第一个具有完整训练数据和配方的开放亚美尼亚 LLM。我们的消融表明,仅新闻的持续预训练提高了流畅性,同时侵蚀了知识,我们在现有的亚美尼亚模型中也观察到了这种模式,并且一小部分经过验证的翻译 STEM 数据扭转了损失。我们进一步发现,最大的亚美尼亚公共语料库与网络衍生的评估小组严重重叠,包括 FineWeb-2 内的训练/测试自我重叠。我们公开发布所有数据、模型和代码。