论文

同等大小的 LLM 中的语言适应基准测试:Llama-3.1-8B、Mistral-7B-v0.1 和 Qwen3-8B 对罗马化尼泊尔语的研究

Benchmarking Linguistic Adaptation in Comparable-Sized LLMs: A Study of Llama-3.1-8B, Mistral-7B-v0.1, and Qwen3-8B on Romanized Nepali

模型评测模型能力评测

摘要

罗马化尼泊尔语(用拉丁字母书写的尼泊尔语)是尼泊尔非正式数字通信的主要媒介,但在 大语言模型 (LLM) 领域,它的资源仍然严重不足。这项研究提出了三个大小相当的开放权重模型的语言适应的系统基准测试:Llama-3.1-8B、Mistral-7B-v0.1 和 Qwen3-8B。我们使用包含 10,000 个音译指令跟踪样本的精选双语数据集在零样本和微调设置下评估这些架构。性能通过涵盖七个测量维度的五个指标进行量化:困惑度 (PPL)、BERTScore、chrF++、ROUGE-1、ROUGE-2、ROUGE-L 和 BLEU,捕获流畅性、语音一致性和语义完整性。在双 NVIDIA Tesla T4 GPU 上使用量化低秩适应 (QLoRA) 和秩稳定 LoRA (rsLoRA) 在 r=32 时对模型进行微调,在不到 27 个总 GPU 小时内仅训练每个模型的大约 1% 的参数。在零样本下,所有三个模型都无法生成罗马化的尼泊尔语,每个模型都表现出独特的特定于架构的故障模式。在 微调 之后,所有三个都解决了这些失败问题,并收敛到 BERTScore 大约 0.75 和 chrF++ 大于 23。跨越十个标准的总体维度评估将 Qwen3-8B 确定为总体推荐架构,是唯一产生语义相关的零样本输出的模型,并领先 SFT 后的所有结构对齐指标。适应余量假设得到证实:Llama-3.1-8B 尽管其零样本基线最弱,但在 PPL (Delta = -49.77) 和 BERTScore (Delta = +0.3287) 方面实现了最大的绝对 微调 增益,使其成为迭代低资源开发管道的首选。这项工作为类似大小的开放权重 LLM 中的罗马化尼泊尔语适应建立了第一个严格的基线。