LLiMba:单 GPU 上的撒丁岛语——使 3B 语言模型适应消失的浪漫语言
LLiMba: Sardinian on a Single GPU -- Adapting a 3B Language Model to a Vanishing Romance Language
摘要
撒丁语是一种罗曼语言,约有 100 万使用者,在现代 NLP 中的存在极少。商业服务不支持它,并且当前的语言模型不能可靠地生成它。我们提出了 LLiMba,这是一个 3B 参数撒丁岛就绪模型,通过持续预训练 (CPT) 改编自 Qwen2.5-3B-Instruct,并在单个 24 GB 消费级 GPU 上进行监督 微调 (SFT)。该语料库包含 1150 万个撒丁语标记,涵盖 LSC、洛多雷语和坎皮达语,并添加了 240 万个相关罗曼语文本标记,作为针对语域模糊的重播。 CPT 后,模型在撒丁岛上的困惑度达到 6.76,并且在所有 6 个 FLORES-200 方向上的表现均优于基础模型。我们在匹配条件下比较了五种 SFT 配置:完整的 微调、LoRA r64、rsLoRA r128、rsLoRA r256 和 DoRA r256。 rsLoRA r256 在进入撒丁岛的各个方向上均获胜,从英语达到 28.5 BLEU,而 CPT 后为 17.3,在完整 微调 下为 21.0。排名消融将 BLEU 上的 r128 置于 LoRA r64 和 rsLoRA r256 之间,但揭示了指标不可见的故障模式,包括其他变体不会产生的跨脚本泄漏。 LoRA r64 与更高级别的配置相比,从 SFT 中保留的事实内容更少,并且产生更自信的构造,尽管所有方法都是根据训练中缺少的内容进行构造的。 DoRA r256 的训练和评估之间的差距最小,但事实准确性最差。研究结果表明,适配器容量比 LoRA 变体中的选择更重要,以便使 Romance 预训练基础适应低资源 Romance 目标,更强的正则化并不总是有益的,并且翻译指标可以顺利地对定性行为明显不同的配置进行排序。跨脚本的困惑度比较必须考虑字节回退标记化,这会缩小拉丁语以外脚本的度量。